인터넷 기술의 지속적인 발전으로 데이터는 매우 귀중한 자원이 되었습니다. 점점 더 많은 기업이 데이터 마이닝 및 분석을 통해 데이터의 가치에 주목하고 경쟁력을 높이기 시작했습니다. 이 과정에서 데이터 수집은 데이터 분석의 첫 번째 단계가 됩니다.
현재 크롤러 기술은 매우 일반적인 데이터 수집 방법입니다. 크롤러 기술을 사용하면 일부 웹사이트의 제품 정보, 포럼 게시물, 뉴스 기사 등 인터넷상의 다양한 데이터를 효과적으로 얻을 수 있습니다. 이 기사에서는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 구현하는 방법을 소개합니다.
1. 셀레늄이란?
Selenium은 Chrome, Firefox, IE 등을 포함한 여러 브라우저를 지원하는 웹 애플리케이션 테스트 도구입니다. Selenium은 링크 클릭, 텍스트 상자에 데이터 입력, 양식 제출 등과 같은 웹에서의 브라우저 작업을 자동화할 수 있습니다.
데이터 수집에서 Selenium을 사용하여 브라우저의 웹 페이지 작동을 시뮬레이션하여 데이터 수집을 실현할 수 있습니다. 일반적으로 데이터를 수집하는 단계는 다음과 같습니다.
2. PHP를 사용하여 Selenium 호출
Selenium 자체가 Java로 작성되어 있으므로 Selenium 스크립트를 Java로 작성한 후 PHP를 사용하여 호출해야 합니다.
먼저 Java 및 Selenium을 설치해야 합니다. 여기서는 Ubuntu를 예로 들어 다음 명령을 실행합니다.
sudo apt-get install default-jre
sudo apt-get install default-jdk
Selenium Java 라이브러리를 다운로드하여 프로젝트 디렉터리에 넣습니다.
프로젝트 디렉토리에서 selenium.php라는 파일을 생성한 후 그 안에 다음 코드와 같은 Java 스크립트를 작성합니다.
import org.openqa.selenium.WebDriver; import org.openqa.selenium.chrome.ChromeDriver; public class SeleniumDemo { public static void main(String[] args) { System.setProperty("webdriver.chrome.driver", "/path/to/chromedriver"); // chromedriver的路径 WebDriver driver = new ChromeDriver(); driver.get("http://www.baidu.com"); // 要访问的网站 String title = driver.getTitle(); // 获取网页标题 System.out.println(title); driver.quit(); // 退出浏览器 } }
이 스크립트는 Chrome 브라우저를 열고 액세스합니다. Baidu 홈페이지에서 웹페이지 제목을 가져와서 출력합니다. "/path/to/chromedriver"를 컴퓨터의 실제 경로로 바꿔야 합니다.
selenium.php 파일에서 exec() 함수를 사용하여 Java 스크립트를 호출합니다. 코드는 다음과 같습니다.
<?php $output = array(); exec("java -cp .:/path/to/selenium-java.jar SeleniumDemo 2>&1", $output); $title = $output[0]; echo $title; ?>
여기서는 PHP의 exec() 함수를 사용하여 Java 스크립트를 호출합니다. , 여기서 " /path/to/selenium-java.jar"는 컴퓨터의 실제 경로로 대체되어야 합니다.
위 코드를 실행하면 바이두의 웹페이지 제목이 화면에 출력되는 것을 볼 수 있습니다.
3. Selenium을 사용하여 데이터 수집 구현
Selenium을 기반으로 데이터 수집 구현을 시작할 수 있습니다. Jingdong Mall의 제품 데이터 수집을 예로 들어 Selenium을 사용하여 구현하는 방법을 보여줍니다.
먼저 JD.com 홈페이지를 열고 수집할 제품을 검색해야 합니다. 이 과정에서 웹 페이지 로딩 시간에 주의해야 합니다. sleep() 함수를 사용하면 일정 시간 동안 프로그램이 일시 중지되고 웹 페이지가 완전히 로드될 때까지 기다릴 수 있습니다.
<?php $output = array(); exec("java -cp .:/path/to/selenium-java.jar JingDongDemo 2>&1", $output); echo $output[0]; // 输出采集到的商品数据 ?> // JingDongDemo.java import org.openqa.selenium.By; import org.openqa.selenium.WebDriver; import org.openqa.selenium.WebElement; import org.openqa.selenium.firefox.FirefoxDriver; import java.util.List; import java.util.concurrent.TimeUnit; public class JingDongDemo { public static void main(String[] args) { System.setProperty("webdriver.gecko.driver", "/path/to/geckodriver"); // geckodriver的路径 WebDriver driver = new FirefoxDriver(); driver.manage().timeouts().implicitlyWait(10, TimeUnit.SECONDS); // 等待网页加载 driver.get("http://www.jd.com"); // 打开网站 driver.findElement(By.id("key")).sendKeys("Iphone 7"); // 输入要搜索的商品 driver.findElement(By.className("button")).click(); // 单击搜索按钮 try { Thread.sleep(5000); // 等待网页完全加载 } catch (InterruptedException e) { e.printStackTrace(); } } }
다음으로 검색 결과에서 제품 데이터를 가져와야 합니다. JD.com 웹페이지에서 제품 데이터는 "gl-item" 클래스를 사용하여 div에 배치됩니다. findElements()를 사용하여 모든 적격 div 요소를 얻고 내용을 하나씩 구문 분석할 수 있습니다.
List<WebElement> productList = driver.findElements(By.className("gl-item")); // 获取所有商品列表项 for(WebElement product : productList) { // 逐个解析商品数据 String name = product.findElement(By.className("p-name")).getText(); String price = product.findElement(By.className("p-price")).getText(); String commentCount = product.findElement(By.className("p-commit")).getText(); String shopName = product.findElement(By.className("p-shop")).getText(); String output = name + " " + price + " " + commentCount + " " + shopName + " "; System.out.println(output); }
이 시점에서 우리는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 성공적으로 구현했습니다. 물론, 웹사이트의 크롤러 방지 전략, 브라우저 및 Selenium 버전 호환성 등 실제 데이터 수집 과정에서 주의해야 할 사항이 많이 있습니다. 이 글이 데이터 수집이 필요한 친구들에게 참고가 되기를 바랍니다.
위 내용은 PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!