利用紐約時報API進行元資料爬取-php教程-PHP中文網

首頁

後端開發

php教程

利用紐約時報API進行元資料爬取

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Sep 02, 2023 pm 10:13 PM

元數據爬取紐約時報api

利用紐約時報API進行元資料爬取

简介

上周，我写了一篇关于抓取网页以收集元数据的介绍，并提到不可能抓取《纽约时报》网站。《纽约时报》付费墙会阻止您收集基本元数据的尝试。但有一种方法可以使用纽约时报 API 来解决这个问题。

最近我开始在 Yii 平台上构建一个社区网站，我将在以后的教程中发布该网站。我希望能够轻松添加与网站内容相关的链接。虽然人们可以轻松地将 URL 粘贴到表单中，但提供标题和来源信息却非常耗时。

因此，在今天的教程中，我将扩展我最近编写的抓取代码，以在添加《纽约时报》链接时利用《纽约时报》API 来收集头条新闻。

请记住，我参与了下面的评论主题，所以请告诉我您的想法！您还可以通过 Twitter @lookahead_io 与我联系。

开始使用

注册 API 密钥

利用紐約時報API進行元資料爬取

首先，让我们注册并请求 API 密钥：

利用紐約時報API進行元資料爬取

提交表单后，您将通过电子邮件收到密钥：

利用紐約時報API進行元資料爬取

探索纽约时报 API

利用紐約時報API進行元資料爬取

The Times 提供以下类别的 API：

存档
文章搜索
书籍
社区
地理
最受欢迎
电影评论
语义
泰晤士报
时代标签
头条新闻

很多。并且，在“图库”页面中，您可以单击任何主题来查看各个 API 类别文档：

利用紐約時報API進行元資料爬取

《纽约时报》使用 LucyBot 为其 API 文档提供支持，并且有一个有用的常见问题解答：

利用紐約時報API進行元資料爬取

他们甚至向您展示如何快速获取 API 使用限制（您需要插入密钥）：

 curl --head 
   https://api.nytimes.com/svc/books/v3/lists/overview.json?api-key=<your-api-key>
    2>/dev/null | grep -i "X-RateLimit"
    X-RateLimit-Limit-day: 1000
    X-RateLimit-Limit-second: 5
    X-RateLimit-Remaining-day: 180
    X-RateLimit-Remaining-second: 5

我最初很难理解该文档 - 它是基于参数的规范，而不是编程指南。不过，我在纽约时报 API GitHub 页面上发布了一些问题，这些问题很快就得到了有用的解答。

使用文章搜索

在今天的节目中，我将重点介绍如何使用《纽约时报》文章搜索。基本上，我们将扩展上一个教程中的创建链接表单：

利用紐約時報API進行元資料爬取

当用户点击查找时，我们将向 链接::grab($url)。这是 jQuery：

$(document).on("click", '[id=lookup]', function(event) {
  $.ajax({
     url: $('#url_prefix').val()+'/link/grab',
     data: {url:   $('#url').val()},
     success: function(data) {
       $('#title').val(data);
       return true;
     }
  });
});

这是控制器和模型方法：

// Controller call via AJAX Lookup request
public static function actionGrab($url) {
  Yii::$app->response->format = Response::FORMAT_JSON;
  return Link::grab($url);
}
...
// Link::grab() method
public static function grab($url) {
  //clean up url for hostname
  $source_url = parse_url($url);
  $source_url = $source_url['host'];  
  $source_url=str_ireplace('www.','',$source_url);
  $source_url = trim($source_url,' \\');
  // use the NYT API when hostname == nytimes.com 
  if ($source_url=='nytimes.com') {
   ...

接下来，让我们使用 API 密钥发出文章搜索请求：

    $nytKey=Yii::$app->params['nytapi'];    
    $curl_dest = 'http://api.nytimes.com
        /svc/search/v2/articlesearch.json?fl=headline&fq=web_url:%22'.
        $url.'%22&api-key='.$nytKey;
    $curl = curl_init();
    curl_setopt($curl, CURLOPT_RETURNTRANSFER, true);
    curl_setopt($curl, CURLOPT_URL,$curl_dest);
    $result = json_decode(curl_exec($curl));
    $title = $result->response->docs[0]->headline->main;
  } else {
    // not NYT, use the standard metatag scraper from last episode
         ...
    }
  }
  return $title;
}

它的工作原理非常简单 - 这是生成的标题（顺便说一句，气候变化正在杀死北极熊，我们应该关心）：

利用紐約時報API進行元資料爬取

如果您想了解 API 请求的更多详细信息，只需向 ?fl 添加其他参数即可=headline 请求例如 关键字 和 lead_paragraph:

Yii::$app->response->format = Response::FORMAT_JSON;
$nytKey=Yii::$app->params['nytapi'];
$curl_dest = 'http://api.nytimes.com/svc/search/v2/articlesearch.json?'.
  'fl=headline,keywords,lead_paragraph&fq=web_url:%22'.$url.'%22&api-key='.$nytKey;
$curl = curl_init();
curl_setopt($curl, CURLOPT_RETURNTRANSFER, true);
curl_setopt($curl, CURLOPT_URL,$curl_dest);
$result = json_decode(curl_exec($curl));
var_dump($result);

结果如下：

利用紐約時報API進行元資料爬取

也许我会在接下来的剧集中编写一个 PHP 库来更好地解析 NYT API，但此代码打破了关键字和引导段落：

Yii::$app->response->format = Response::FORMAT_JSON;
$nytKey=Yii::$app->params['nytapi'];
$curl_dest = 'http://api.nytimes.com/svc/search/v2/articlesearch.json?'.
  'fl=headline,keywords,lead_paragraph&fq=web_url:%22'.$url.'%22&api-key='.$nytKey;
$curl = curl_init();
curl_setopt($curl, CURLOPT_RETURNTRANSFER, true);
curl_setopt($curl, CURLOPT_URL,$curl_dest);
$result = json_decode(curl_exec($curl));
echo $result->response->docs[0]->headline->main.'<br />'.'<br />';
echo $result->response->docs[0]->lead_paragraph.'<br />'.'<br />';
foreach ($result->response->docs[0]->keywords as $k) {
  echo $k->value.'<br/>';
}

以下是本文显示的内容：

Polar Bears’ Path to Decline Runs Through Alaskan Village

The bears that come here are climate refugees, on land because
the sea ice they rely on for hunting seals is receding.

Polar Bears
Greenhouse Gas Emissions
Alaska
Global Warming
Endangered and Extinct Species
International Union for Conservation of Nature
National Snow and Ice Data Center
Polar Bears International
United States Geological Survey

希望这能开始扩展您对如何使用这些 API 的想象力。现在可能实现的事情非常令人兴奋。

结束中

纽约时报 API 非常有用，我很高兴看到他们向开发者社区提供它。通过 GitHub 获得如此快速的 API 支持也令人耳目一新——我只是没想到会这样。请记住，它适用于非商业项目。如果您有一些赚钱的想法，请给他们留言，看看他们是否愿意与您合作。出版商渴望新的收入来源。

我希望您發現這些網頁抓取片段很有幫助，並將其運用到您的專案中。如果您想觀看今天的節目，可以在我的網站 Active Together 上嘗試一些網頁抓取。

請在評論中分享任何想法和回饋。您也可以隨時透過 Twitter @lookahead_io 直接聯繫我。請務必查看我的講師頁面和其他系列：使用 PHP 建立您的新創公司並使用 Yii2 進行程式設計。

相關連結

紐約時報 API 庫
GitHub 上的《紐約時報》公共 API 規格
如何抓取網頁中的元資料 (Envato Tuts )
如何使用 Node.js 和 jQuery 抓取網頁 (Envato Tuts )
用 Ruby 建立您的第一個 Web Scraper (Envato Tuts )

以上是利用紐約時報API進行元資料爬取的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

哪些常見問題會導致PHP會話失敗？Apr 25, 2025 am 12:16 AM

PHPSession失效的原因包括配置錯誤、Cookie問題和Session過期。 1.配置錯誤：檢查並設置正確的session.save_path。 2.Cookie問題：確保Cookie設置正確。 3.Session過期：調整session.gc_maxlifetime值以延長會話時間。

您如何在PHP中調試與會話相關的問題？Apr 25, 2025 am 12:12 AM

在PHP中調試會話問題的方法包括：1.檢查會話是否正確啟動；2.驗證會話ID的傳遞；3.檢查會話數據的存儲和讀取；4.查看服務器配置。通過輸出會話ID和數據、查看會話文件內容等方法，可以有效診斷和解決會話相關的問題。

如果session_start（）被多次調用會發生什麼？Apr 25, 2025 am 12:06 AM

多次調用session_start()會導致警告信息和可能的數據覆蓋。 1)PHP會發出警告，提示session已啟動。 2)可能導致session數據意外覆蓋。 3)使用session_status()檢查session狀態，避免重複調用。

您如何在PHP中配置會話壽命？Apr 25, 2025 am 12:05 AM

在PHP中配置會話生命週期可以通過設置session.gc_maxlifetime和session.cookie_lifetime來實現。 1)session.gc_maxlifetime控制服務器端會話數據的存活時間，2)session.cookie_lifetime控制客戶端cookie的生命週期，設置為0時cookie在瀏覽器關閉時過期。

使用數據庫存儲會話的優點是什麼？Apr 24, 2025 am 12:16 AM

使用數據庫存儲會話的主要優勢包括持久性、可擴展性和安全性。 1.持久性：即使服務器重啟，會話數據也能保持不變。 2.可擴展性：適用於分佈式系統，確保會話數據在多服務器間同步。 3.安全性：數據庫提供加密存儲，保護敏感信息。

您如何在PHP中實現自定義會話處理？Apr 24, 2025 am 12:16 AM

在PHP中實現自定義會話處理可以通過實現SessionHandlerInterface接口來完成。具體步驟包括：1)創建實現SessionHandlerInterface的類，如CustomSessionHandler；2)重寫接口中的方法（如open,close,read,write,destroy,gc）來定義會話數據的生命週期和存儲方式；3)在PHP腳本中註冊自定義會話處理器並啟動會話。這樣可以將數據存儲在MySQL、Redis等介質中，提升性能、安全性和可擴展性。

什麼是會話ID？Apr 24, 2025 am 12:13 AM

SessionID是網絡應用程序中用來跟踪用戶會話狀態的機制。 1.它是一個隨機生成的字符串，用於在用戶與服務器之間的多次交互中保持用戶的身份信息。 2.服務器生成並通過cookie或URL參數發送給客戶端，幫助在用戶的多次請求中識別和關聯這些請求。 3.生成通常使用隨機算法保證唯一性和不可預測性。 4.在實際開發中，可以使用內存數據庫如Redis來存儲session數據，提升性能和安全性。