>  기사  >  백엔드 개발  >  PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현

PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현

PHPz
PHPz원래의
2023-06-16 12:15:101471검색

인터넷 기술의 지속적인 발전으로 데이터는 매우 귀중한 자원이 되었습니다. 점점 더 많은 기업이 데이터 마이닝 및 분석을 통해 데이터의 가치에 주목하고 경쟁력을 높이기 시작했습니다. 이 과정에서 데이터 수집은 데이터 분석의 첫 번째 단계가 됩니다.

현재 크롤러 기술은 매우 일반적인 데이터 수집 방법입니다. 크롤러 기술을 사용하면 일부 웹사이트의 제품 정보, 포럼 게시물, 뉴스 기사 등 인터넷상의 다양한 데이터를 효과적으로 얻을 수 있습니다. 이 기사에서는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 구현하는 방법을 소개합니다.

1. 셀레늄이란?

Selenium은 Chrome, Firefox, IE 등을 포함한 여러 브라우저를 지원하는 웹 애플리케이션 테스트 도구입니다. Selenium은 링크 클릭, 텍스트 상자에 데이터 입력, 양식 제출 등과 같은 웹에서의 브라우저 작업을 자동화할 수 있습니다.

데이터 수집에서 Selenium을 사용하여 브라우저의 웹 페이지 작동을 시뮬레이션하여 데이터 수집을 실현할 수 있습니다. 일반적으로 데이터를 수집하는 단계는 다음과 같습니다.

  1. Selenium을 사용하여 수집할 웹페이지를 엽니다.
  2. 텍스트 상자에 데이터를 입력하거나 버튼을 클릭하는 등 웹페이지에서 작업을 수행합니다.
  3. Get 필수 데이터

2. PHP를 사용하여 Selenium 호출

Selenium 자체가 Java로 작성되어 있으므로 Selenium 스크립트를 Java로 작성한 후 PHP를 사용하여 호출해야 합니다.

  1. Java 및 Selenium 설치

먼저 Java 및 Selenium을 설치해야 합니다. 여기서는 Ubuntu를 예로 들어 다음 명령을 실행합니다.

sudo apt-get install default-jre

sudo apt-get install default-jdk

Selenium Java 라이브러리를 다운로드하여 프로젝트 디렉터리에 넣습니다.

  1. Selenium 스크립트 작성

프로젝트 디렉토리에서 selenium.php라는 파일을 생성한 후 그 안에 다음 코드와 같은 Java 스크립트를 작성합니다.

import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;

public class SeleniumDemo {
 public static void main(String[] args) {
  System.setProperty("webdriver.chrome.driver", "/path/to/chromedriver"); // chromedriver的路径
  WebDriver driver = new ChromeDriver();
  driver.get("http://www.baidu.com"); // 要访问的网站
  String title = driver.getTitle(); // 获取网页标题
  System.out.println(title);
  driver.quit(); // 退出浏览器
 }
}

이 스크립트는 Chrome 브라우저를 열고 액세스합니다. Baidu 홈페이지에서 웹페이지 제목을 가져와서 출력합니다. "/path/to/chromedriver"를 컴퓨터의 실제 경로로 바꿔야 합니다.

  1. Call Selenium

selenium.php 파일에서 exec() 함수를 사용하여 Java 스크립트를 호출합니다. 코드는 다음과 같습니다.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar SeleniumDemo 2>&1", $output);
$title = $output[0];
echo $title;
?>

여기서는 PHP의 exec() 함수를 사용하여 Java 스크립트를 호출합니다. , 여기서 " /path/to/selenium-java.jar"는 컴퓨터의 실제 경로로 대체되어야 합니다.

위 코드를 실행하면 바이두의 웹페이지 제목이 화면에 출력되는 것을 볼 수 있습니다.

3. Selenium을 사용하여 데이터 수집 구현

Selenium을 기반으로 데이터 수집 구현을 시작할 수 있습니다. Jingdong Mall의 제품 데이터 수집을 예로 들어 Selenium을 사용하여 구현하는 방법을 보여줍니다.

  1. 웹페이지 열기

먼저 JD.com 홈페이지를 열고 수집할 제품을 검색해야 합니다. 이 과정에서 웹 페이지 로딩 시간에 주의해야 합니다. sleep() 함수를 사용하면 일정 시간 동안 프로그램이 일시 중지되고 웹 페이지가 완전히 로드될 때까지 기다릴 수 있습니다.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar JingDongDemo 2>&1", $output);
echo $output[0]; // 输出采集到的商品数据
?>

// JingDongDemo.java

import org.openqa.selenium.By;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.WebElement;
import org.openqa.selenium.firefox.FirefoxDriver;
import java.util.List;
import java.util.concurrent.TimeUnit;

public class JingDongDemo {

 public static void main(String[] args) {
  System.setProperty("webdriver.gecko.driver", "/path/to/geckodriver"); // geckodriver的路径
  WebDriver driver = new FirefoxDriver();
  driver.manage().timeouts().implicitlyWait(10, TimeUnit.SECONDS); // 等待网页加载
  driver.get("http://www.jd.com"); // 打开网站
  driver.findElement(By.id("key")).sendKeys("Iphone 7"); // 输入要搜索的商品
  driver.findElement(By.className("button")).click(); // 单击搜索按钮
  try {
   Thread.sleep(5000); // 等待网页完全加载
  } catch (InterruptedException e) {
   e.printStackTrace();
  }
 }
}
  1. 제품 데이터 가져오기

다음으로 검색 결과에서 제품 데이터를 가져와야 합니다. JD.com 웹페이지에서 제품 데이터는 "gl-item" 클래스를 사용하여 div에 배치됩니다. findElements()를 사용하여 모든 적격 div 요소를 얻고 내용을 하나씩 구문 분석할 수 있습니다.

List<WebElement> productList = driver.findElements(By.className("gl-item")); // 获取所有商品列表项

for(WebElement product : productList) { // 逐个解析商品数据
 String name = product.findElement(By.className("p-name")).getText();
 String price = product.findElement(By.className("p-price")).getText();
 String commentCount = product.findElement(By.className("p-commit")).getText();
 String shopName = product.findElement(By.className("p-shop")).getText();
 String output = name + "    " + price + "    " + commentCount + "    " + shopName + "
";
 System.out.println(output);
}

이 시점에서 우리는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 성공적으로 구현했습니다. 물론, 웹사이트의 크롤러 방지 전략, 브라우저 및 Selenium 버전 호환성 등 실제 데이터 수집 과정에서 주의해야 할 사항이 많이 있습니다. 이 글이 데이터 수집이 필요한 친구들에게 참고가 되기를 바랍니다.

위 내용은 PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.