検索
ホームページJava&#&チュートリアルJavaScript Web サイトを効率的にスクレイピングする

Effizientes Scrapen von JavaScript-Webseiten

Web クローリングに JavaScript を使用する可能性

静的 Web サイト: Axios と Cheerio
JavaScript を使用して静的 e コマース Web サイトをクロールする手順を見てみましょう。この例では、HTTP リクエスト用の Axios と HTML 解析用の Cheerio という 2 つの一般的なライブラリを使用します。

*1.依存関係をインストールします *
npm:

を使用して Axios と Cheerio をインストールします。 npm install axios Cherio

*2.スクリプトの作成 *
JavaScript ファイルを作成します。 B.Ecommerce.js をスクレイピングし、コード エディターで開きます。

*3.モジュールのインポート *
Axios と Cheerio をスクリプトにインポートします:

const axios = require('axios');

const チェリオ = require('チェリオ');

*4.ターゲット URL を定義 *
アクセスしたい電子商取引 Web サイトを選択します。この例では、仮想 URL http://example-ecommerce.com を使用します。これを目的の URL に置き換えます:

const url = 'http://example-ecommerce.com';

*5. HTML コンテンツを取得 *
Axios を使用して、ターゲット URL に GET リクエストを送信し、HTML コンテンツを取得します:

axios.get(url)

.then(response => {

const html = 応答.データ;

// HTML コンテンツを解析できるようになりました

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*6. HTML を解析してデータを抽出します *
Cheerio を使用して HTML コードを解析し、製品名や価格などの必要な情報を抽出します:

axios.get(url)

.then(response => {

const html = 応答.データ;

const $ = Cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*最重要ポイント*

  • axios.get(url): GET リクエストを送信し、Promise を返します。
  • .then(response => { … }): リクエストが成功した場合、HTML コンテンツは response.data にあります。
  • cheerio.load(html): DOM を jQuery のように操作するために、HTML コンテンツを Cheerio にロードします。
  • $('.product').each((index, element) => { … }): すべての .product 要素を反復処理します。
  • $(element).find('.product-name').text().trim(): 製品名を抽出します。
  • $(element).find('.product-price').text().trim(): 商品の価格を抽出します。
  • products.push({ name, Price }): 製品情報を products 配列に追加します。
  • console.log(products): 抽出した情報を出力します。

*完全なスクリプト例: *
const axios = require('axios');

const チェリオ = require('チェリオ');

const url = 'http://example-ecommerce.com';

axios.get(url)

.then(response => {

const html = 応答.データ;

const $ = Cheerio.load(html);

const products = [];  

$('.product').each((index, element) => {  
  const name = $(element).find('.product-name').text().trim();  
  const price = $(element).find('.product-price').text().trim();  
  products.push({ name, price });  
});  

console.log(products);  

})

.catch(error => {

console.error('ページの取得エラー:', error);

});

*ランディング ページのカスタマイズ: *

  • セレクター: .product、.product-name、および .product-price セレクターは、ターゲット ページの実際の HTML 構造に適合させる必要があります。
  • 追加データ: 追加情報 (製品画像、リンク、説明など) については、対応する HTML 構造を確認してください。

JavaScriptを使用してWebサイトをスクレイピングするWebスクレイピングツール

最近、Web スクレイピングに Python、Ruby、または別のプログラミング言語が必要になった場合、Octoparse は、特に JavaScript をサポートする Web サイトにとって優れたツールです。

具体的な例を見てみましょう: 対象の Web サイトがあり、スクレイピングを開始したい場合は、まずそのサイトが JS スクレイピングに対してブロックされているかどうかを確認する必要があります。 Web サイトごとに使用する保護方法が異なるため、特にスクレイピングで期待どおりの結果が得られない場合、何かが間違っていることに気づくまでに時間がかかり、イライラする試行が必要になる場合があります。ただし、Web スクレイピング ツールを使用すると、データ抽出プロセスがスムーズに進みます。

多くの Web スクレイピング ツールは、クローラーを作成する手間を省きます。 Octoparse は、JavaScript の多いページをスクレイピングする際に特に効率的であり、Ajax を使用するページを含む Web ページの 99% からデータを抽出できます。キャプチャ解決サービスも提供します。 Octoparse は無料で使用でき、自動検出機能と、効率的なデータ抽出を可能にする 100 を超える使いやすいテンプレートを提供します。新規ユーザーも 14 日間のトライアルを利用できます。

以上がJavaScript Web サイトを効率的にスクレイピングするの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。
2025年のトップ4 JavaScriptフレームワーク:React、Angular、Vue、Svelte2025年のトップ4 JavaScriptフレームワーク:React、Angular、Vue、SvelteMar 07, 2025 pm 06:09 PM

この記事では、2025年の上位4つのJavaScriptフレームワーク(React、Angular、Vue、Svelte)を分析し、パフォーマンス、スケーラビリティ、将来の見通しを比較します。 強力なコミュニティと生態系のためにすべてが支配的なままですが、彼らの相対的なポップ

Spring Boot Snakeyaml 2.0 CVE-2022-1471問題修正Spring Boot Snakeyaml 2.0 CVE-2022-1471問題修正Mar 07, 2025 pm 05:52 PM

この記事では、リモートコードの実行を可能にする重大な欠陥であるSnakeyamlのCVE-2022-1471の脆弱性について説明します。 Snakeyaml 1.33以降のSpring Bootアプリケーションをアップグレードする方法は、このリスクを軽減する方法を詳述し、その依存関係のアップデートを強調しています

カフェインやグアバキャッシュなどのライブラリを使用して、Javaアプリケーションにマルチレベルキャッシュを実装するにはどうすればよいですか?カフェインやグアバキャッシュなどのライブラリを使用して、Javaアプリケーションにマルチレベルキャッシュを実装するにはどうすればよいですか?Mar 17, 2025 pm 05:44 PM

この記事では、カフェインとグアバキャッシュを使用してJavaでマルチレベルキャッシュを実装してアプリケーションのパフォーマンスを向上させています。セットアップ、統合、パフォーマンスの利点をカバーし、構成と立ち退きポリシー管理Best Pra

Javaのクラスロードメカニズムは、さまざまなクラスローダーやその委任モデルを含むどのように機能しますか?Javaのクラスロードメカニズムは、さまざまなクラスローダーやその委任モデルを含むどのように機能しますか?Mar 17, 2025 pm 05:35 PM

Javaのクラスロードには、ブートストラップ、拡張機能、およびアプリケーションクラスローダーを備えた階層システムを使用して、クラスの読み込み、リンク、および初期化が含まれます。親の委任モデルは、コアクラスが最初にロードされ、カスタムクラスのLOAに影響を与えることを保証します

node.js 20:キーパフォーマンスが向上し、新機能node.js 20:キーパフォーマンスが向上し、新機能Mar 07, 2025 pm 06:12 PM

node.js 20は、V8エンジンの改善、特により速いガベージコレクションとI/Oを介してパフォーマンスを大幅に向上させます。 新機能には、より良いWebセンブリのサポートと洗練されたデバッグツール、開発者の生産性とアプリケーション速度の向上が含まれます。

Iceberg:データレイクテーブルの未来Iceberg:データレイクテーブルの未来Mar 07, 2025 pm 06:31 PM

大規模な分析データセットのオープンテーブル形式であるIcebergは、データの湖のパフォーマンスとスケーラビリティを向上させます。 内部メタデータ管理を通じて、寄木細工/ORCの制限に対処し、効率的なスキーマの進化、タイムトラベル、同時wを可能にします

キュウリのステップ間でデータを共有する方法キュウリのステップ間でデータを共有する方法Mar 07, 2025 pm 05:55 PM

この記事では、キュウリの手順間でデータを共有する方法、シナリオコンテキスト、グローバル変数、引数の合格、およびデータ構造を比較する方法を調べます。 簡潔なコンテキストの使用、記述など、保守性のためのベストプラクティスを強調しています

Javaで機能的なプログラミング技術を実装するにはどうすればよいですか?Javaで機能的なプログラミング技術を実装するにはどうすればよいですか?Mar 11, 2025 pm 05:51 PM

この記事では、Lambda式、Streams API、メソッド参照、およびオプションを使用して、機能プログラミングをJavaに統合することを調べます。 それは、簡潔さと不変性を通じてコードの読みやすさと保守性の改善などの利点を強調しています

See all articles

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

Dreamweaver Mac版

Dreamweaver Mac版

ビジュアル Web 開発ツール

SublimeText3 Linux 新バージョン

SublimeText3 Linux 新バージョン

SublimeText3 Linux 最新バージョン

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

SublimeText3 英語版

SublimeText3 英語版

推奨: Win バージョン、コードプロンプトをサポート!

ZendStudio 13.5.1 Mac

ZendStudio 13.5.1 Mac

強力な PHP 統合開発環境