PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현-PHP 튜토리얼-php.cn

집

백엔드 개발

PHP 튜토리얼

PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현

PHPz

Jun 16, 2023 pm 12:15 PM

php비열한selenium

인터넷 기술의 지속적인 발전으로 데이터는 매우 귀중한 자원이 되었습니다. 점점 더 많은 기업이 데이터 마이닝 및 분석을 통해 데이터의 가치에 주목하고 경쟁력을 높이기 시작했습니다. 이 과정에서 데이터 수집은 데이터 분석의 첫 번째 단계가 됩니다.

현재 크롤러 기술은 매우 일반적인 데이터 수집 방법입니다. 크롤러 기술을 사용하면 일부 웹사이트의 제품 정보, 포럼 게시물, 뉴스 기사 등 인터넷상의 다양한 데이터를 효과적으로 얻을 수 있습니다. 이 기사에서는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 구현하는 방법을 소개합니다.

1. 셀레늄이란?

Selenium은 Chrome, Firefox, IE 등을 포함한 여러 브라우저를 지원하는 웹 애플리케이션 테스트 도구입니다. Selenium은 링크 클릭, 텍스트 상자에 데이터 입력, 양식 제출 등과 같은 웹에서의 브라우저 작업을 자동화할 수 있습니다.

데이터 수집에서 Selenium을 사용하여 브라우저의 웹 페이지 작동을 시뮬레이션하여 데이터 수집을 실현할 수 있습니다. 일반적으로 데이터를 수집하는 단계는 다음과 같습니다.

Selenium을 사용하여 수집할 웹페이지를 엽니다.
텍스트 상자에 데이터를 입력하거나 버튼을 클릭하는 등 웹페이지에서 작업을 수행합니다.
Get 필수 데이터

2. PHP를 사용하여 Selenium 호출

Selenium 자체가 Java로 작성되어 있으므로 Selenium 스크립트를 Java로 작성한 후 PHP를 사용하여 호출해야 합니다.

Java 및 Selenium 설치

먼저 Java 및 Selenium을 설치해야 합니다. 여기서는 Ubuntu를 예로 들어 다음 명령을 실행합니다.

sudo apt-get install default-jre

sudo apt-get install default-jdk

Selenium Java 라이브러리를 다운로드하여 프로젝트 디렉터리에 넣습니다.

Selenium 스크립트 작성

프로젝트 디렉토리에서 selenium.php라는 파일을 생성한 후 그 안에 다음 코드와 같은 Java 스크립트를 작성합니다.

import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;

public class SeleniumDemo {
 public static void main(String[] args) {
  System.setProperty("webdriver.chrome.driver", "/path/to/chromedriver"); // chromedriver的路径
  WebDriver driver = new ChromeDriver();
  driver.get("http://www.baidu.com"); // 要访问的网站
  String title = driver.getTitle(); // 获取网页标题
  System.out.println(title);
  driver.quit(); // 退出浏览器
 }
}

이 스크립트는 Chrome 브라우저를 열고 액세스합니다. Baidu 홈페이지에서 웹페이지 제목을 가져와서 출력합니다. "/path/to/chromedriver"를 컴퓨터의 실제 경로로 바꿔야 합니다.

Call Selenium

selenium.php 파일에서 exec() 함수를 사용하여 Java 스크립트를 호출합니다. 코드는 다음과 같습니다.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar SeleniumDemo 2>&1", $output);
$title = $output[0];
echo $title;
?>

여기서는 PHP의 exec() 함수를 사용하여 Java 스크립트를 호출합니다. , 여기서 " /path/to/selenium-java.jar"는 컴퓨터의 실제 경로로 대체되어야 합니다.

위 코드를 실행하면 바이두의 웹페이지 제목이 화면에 출력되는 것을 볼 수 있습니다.

3. Selenium을 사용하여 데이터 수집 구현

Selenium을 기반으로 데이터 수집 구현을 시작할 수 있습니다. Jingdong Mall의 제품 데이터 수집을 예로 들어 Selenium을 사용하여 구현하는 방법을 보여줍니다.

웹페이지 열기

먼저 JD.com 홈페이지를 열고 수집할 제품을 검색해야 합니다. 이 과정에서 웹 페이지 로딩 시간에 주의해야 합니다. sleep() 함수를 사용하면 일정 시간 동안 프로그램이 일시 중지되고 웹 페이지가 완전히 로드될 때까지 기다릴 수 있습니다.

<?php
$output = array();
exec("java -cp .:/path/to/selenium-java.jar JingDongDemo 2>&1", $output);
echo $output[0]; // 输出采集到的商品数据
?>

// JingDongDemo.java

import org.openqa.selenium.By;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.WebElement;
import org.openqa.selenium.firefox.FirefoxDriver;
import java.util.List;
import java.util.concurrent.TimeUnit;

public class JingDongDemo {

 public static void main(String[] args) {
  System.setProperty("webdriver.gecko.driver", "/path/to/geckodriver"); // geckodriver的路径
  WebDriver driver = new FirefoxDriver();
  driver.manage().timeouts().implicitlyWait(10, TimeUnit.SECONDS); // 等待网页加载
  driver.get("http://www.jd.com"); // 打开网站
  driver.findElement(By.id("key")).sendKeys("Iphone 7"); // 输入要搜索的商品
  driver.findElement(By.className("button")).click(); // 单击搜索按钮
  try {
   Thread.sleep(5000); // 等待网页完全加载
  } catch (InterruptedException e) {
   e.printStackTrace();
  }
 }
}

제품 데이터 가져오기

다음으로 검색 결과에서 제품 데이터를 가져와야 합니다. JD.com 웹페이지에서 제품 데이터는 "gl-item" 클래스를 사용하여 div에 배치됩니다. findElements()를 사용하여 모든 적격 div 요소를 얻고 내용을 하나씩 구문 분석할 수 있습니다.

List<WebElement> productList = driver.findElements(By.className("gl-item")); // 获取所有商品列表项

for(WebElement product : productList) { // 逐个解析商品数据
 String name = product.findElement(By.className("p-name")).getText();
 String price = product.findElement(By.className("p-price")).getText();
 String commentCount = product.findElement(By.className("p-commit")).getText();
 String shopName = product.findElement(By.className("p-shop")).getText();
 String output = name + "    " + price + "    " + commentCount + "    " + shopName + "
";
 System.out.println(output);
}

이 시점에서 우리는 PHP와 Selenium을 사용하여 크롤러 데이터 수집을 성공적으로 구현했습니다. 물론, 웹사이트의 크롤러 방지 전략, 브라우저 및 Selenium 버전 호환성 등 실제 데이터 수집 과정에서 주의해야 할 사항이 많이 있습니다. 이 글이 데이터 수집이 필요한 친구들에게 참고가 되기를 바랍니다.

위 내용은 PHP 및 Selenium을 사용하여 크롤러 데이터 수집 구현의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

관련 기사

과대 광고 : 오늘 PHP의 역할을 평가합니다Apr 12, 2025 am 12:17 AM

PHP는 현대적인 프로그래밍, 특히 웹 개발 분야에서 강력하고 널리 사용되는 도구로 남아 있습니다. 1) PHP는 사용하기 쉽고 데이터베이스와 완벽하게 통합되며 많은 개발자에게 가장 먼저 선택됩니다. 2) 동적 컨텐츠 생성 및 객체 지향 프로그래밍을 지원하여 웹 사이트를 신속하게 작성하고 유지 관리하는 데 적합합니다. 3) 데이터베이스 쿼리를 캐싱하고 최적화함으로써 PHP의 성능을 향상시킬 수 있으며, 광범위한 커뮤니티와 풍부한 생태계는 오늘날의 기술 스택에 여전히 중요합니다.

PHP의 약한 참고 자료는 무엇이며 언제 유용합니까?Apr 12, 2025 am 12:13 AM

PHP에서는 약한 참조가 약한 회의 클래스를 통해 구현되며 쓰레기 수집가가 물체를 되 찾는 것을 방해하지 않습니다. 약한 참조는 캐싱 시스템 및 이벤트 리스너와 같은 시나리오에 적합합니다. 물체의 생존을 보장 할 수 없으며 쓰레기 수집이 지연 될 수 있음에 주목해야합니다.

PHP의 __invoke 마법 방법을 설명하십시오.Apr 12, 2025 am 12:07 AM

\ _ \ _ 호출 메소드를 사용하면 객체를 함수처럼 호출 할 수 있습니다. 1. 객체를 호출 할 수 있도록 메소드를 호출하는 \ _ \ _ 정의하십시오. 2. $ obj (...) 구문을 사용할 때 PHP는 \ _ \ _ invoke 메소드를 실행합니다. 3. 로깅 및 계산기, 코드 유연성 및 가독성 향상과 같은 시나리오에 적합합니다.

동시성에 대해 PHP 8.1의 섬유를 설명하십시오.Apr 12, 2025 am 12:05 AM

섬유는 PHP8.1에 도입되어 동시 처리 기능을 향상시켰다. 1) 섬유는 코 루틴과 유사한 가벼운 동시성 모델입니다. 2) 개발자는 작업의 실행 흐름을 수동으로 제어 할 수 있으며 I/O 집약적 작업을 처리하는 데 적합합니다. 3) 섬유를 사용하면보다 효율적이고 반응이 좋은 코드를 작성할 수 있습니다.

PHP 커뮤니티 : 자원, 지원 및 개발Apr 12, 2025 am 12:04 AM

PHP 커뮤니티는 개발자 성장을 돕기 위해 풍부한 자원과 지원을 제공합니다. 1) 자료에는 공식 문서, 튜토리얼, 블로그 및 Laravel 및 Symfony와 같은 오픈 소스 프로젝트가 포함됩니다. 2) 지원은 StackoverFlow, Reddit 및 Slack 채널을 통해 얻을 수 있습니다. 3) RFC에 따라 개발 동향을 배울 수 있습니다. 4) 적극적인 참여, 코드에 대한 기여 및 학습 공유를 통해 커뮤니티에 통합 될 수 있습니다.

PHP vs. Python : 차이점 이해Apr 11, 2025 am 12:15 AM

PHP와 Python은 각각 고유 한 장점이 있으며 선택은 프로젝트 요구 사항을 기반으로해야합니다. 1.PHP는 간단한 구문과 높은 실행 효율로 웹 개발에 적합합니다. 2. Python은 간결한 구문 및 풍부한 라이브러리를 갖춘 데이터 과학 및 기계 학습에 적합합니다.

PHP : 죽어 가거나 단순히 적응하고 있습니까?Apr 11, 2025 am 12:13 AM

PHP는 죽지 않고 끊임없이 적응하고 진화합니다. 1) PHP는 1994 년부터 새로운 기술 트렌드에 적응하기 위해 여러 버전 반복을 겪었습니다. 2) 현재 전자 상거래, 컨텐츠 관리 시스템 및 기타 분야에서 널리 사용됩니다. 3) PHP8은 성능과 현대화를 개선하기 위해 JIT 컴파일러 및 기타 기능을 소개합니다. 4) Opcache를 사용하고 PSR-12 표준을 따라 성능 및 코드 품질을 최적화하십시오.

PHP의 미래 : 적응 및 혁신Apr 11, 2025 am 12:01 AM

PHP의 미래는 새로운 기술 트렌드에 적응하고 혁신적인 기능을 도입함으로써 달성 될 것입니다. 1) 클라우드 컴퓨팅, 컨테이너화 및 마이크로 서비스 아키텍처에 적응, Docker 및 Kubernetes 지원; 2) 성능 및 데이터 처리 효율을 향상시키기 위해 JIT 컴파일러 및 열거 유형을 도입합니다. 3) 지속적으로 성능을 최적화하고 모범 사례를 홍보합니다.

See all articles

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

Eclipse용 SAP NetWeaver 서버 어댑터

Eclipse를 SAP NetWeaver 애플리케이션 서버와 통합합니다.

PhpStorm 맥 버전

최신(2018.2.1) 전문 PHP 통합 개발 도구

안전한 시험 브라우저

안전한 시험 브라우저는 온라인 시험을 안전하게 치르기 위한 보안 브라우저 환경입니다. 이 소프트웨어는 모든 컴퓨터를 안전한 워크스테이션으로 바꿔줍니다. 이는 모든 유틸리티에 대한 액세스를 제어하고 학생들이 승인되지 않은 리소스를 사용하는 것을 방지합니다.

Dreamweaver Mac版

시각적 웹 개발 도구

MinGW - Windows용 미니멀리스트 GNU

이 프로젝트는 osdn.net/projects/mingw로 마이그레이션되는 중입니다. 계속해서 그곳에서 우리를 팔로우할 수 있습니다. MinGW: GCC(GNU Compiler Collection)의 기본 Windows 포트로, 기본 Windows 애플리케이션을 구축하기 위한 무료 배포 가능 가져오기 라이브러리 및 헤더 파일로 C99 기능을 지원하는 MSVC 런타임에 대한 확장이 포함되어 있습니다. 모든 MinGW 소프트웨어는 64비트 Windows 플랫폼에서 실행될 수 있습니다.