Curl号称强大，却在抓花瓣网的首页时，怎么也不能成功，求解！！！！！！！-php教程-PHP中文網

首頁

後端開發

php教程

Curl号称强大，却在抓花瓣网的首页时，怎么也不能成功，求解！！！！！！！

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 23, 2016 pm 02:21 PM

一直用curl抓页面，十分方便，屡试屡爽，却在抓取花瓣网首页的一个看似简单的操作中，发现怎么也不能成功。

基本代码如下：
$ch = curl_init();
curl_setopt($ch,CURLOPT_URL, 'http://huaban.com/');
//模拟蜘蛛
//curl_setopt($ch, CURLOPT_USERAGENT, 'Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)');
//模拟普通浏览器
curl_setopt($ch, CURLOPT_USERAGENT, 'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0; .NET CLR 2.0.50727)');
//可以不要cookie，因为不登陆，能返回首页即可
//curl_setopt($ch, CURLOPT_USERAGENT, '');
//其实也可以不要来路，模拟直接输入地址的
curl_setopt($ch, CURLOPT_REFERER, 'http://huaban.com/');
//curl_setopt($ch, CURLOPT_HTTPHEADER, $header);
//curl_setopt($ch, CURLOPT_HEADER, 0); //输出header
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 0);
curl_exec($ch);
curl_close($ch);

我已经反复尝试不同的cookie header agent，都不能返回如同浏览器打开的那种可见页面，甚至尝试过 file_get_contents('http://huaban.com/'); 都没用。返回的内容，绝大部分内容为js代码，但之前成功抓取的页面，包括各种大小网站，也有js，并不影响远程抓取和显示啊。试了一天，百思不得其解，在csdn qq群里面也进行了讨论，有人说可能是curl不能运行js。但现在哪个网站没有js代码能，之前抓取的那些站，js也不在少数啊。没有一个失败的。。

实在不知道怎么解决，将这个问题丢出来，恳请高人作答。到底是curl不行呢，还是这个网站太变态呢，还是方法不对呢？。。。。

回复讨论(解决方案)

这种优雅的小清新网站，没JS还让它怎么存活在这个竞争惨烈的市场？

这个网站的特别之处就是它的绝大部分内容都是js动态生成的，通过js与后端程序交互不断的产生新内容
所以用curl抓取的只是它最初始的代码，也就是大段的js了

这个网站的特别之处就是它的绝大部分内容都是js动态生成的，通过js与后端程序交互不断的产生新内容
所以用curl抓取的只是它最初始的代码，也就是大段的js了

"js与后端程序交互不断的产生新内容"????
按说这个过程可以通过抓包程序捕获啊，ajax的内容都可以捕获，这个为什么不能呢？
通过抓包也没有发现什么访问，按理说，访问总的有个地址吧

这是你要的数据吧?不知道你是怎么个抓包法
{"filter":"pin:category:all","pins":[{"pin_id":8447271,"user_id":394332,"board_id":1146189,"file_id":3483249,"file":{"farm":"farm1","bucket":"hbimg","key":"a1524741e8fae0916ba04c8d231f8ad23173ddb5baeff-rNFCpP","type":"image/jpeg","width":440,"height":5779,"frames":1},"media_type":0,"source":"weibo.com","link":"http://weibo.com/2134919185/yoVlDsGWs","raw_text":"小小灯泡大改造，你也来动手做一个吧~","text_meta":{},"via":2,"via_user_id":0,"original":null,"created_at":1340276725,"like_count":0,"comment_count":0,"repin_count":0,"is_private":0,"orig_source":"http://ww4.sinaimg.cn/bmiddle/7f404811jw1du5vv6dpnij.jpg","user":{"user_id":394332,"username":"Havetogo","urlname":"shouji132136652610","created_at":1338984624,"avatar":{"id":3061779,"farm":"farm1","bucket":"hbimg","key":"69d6d7842159946de9ca070c22da1714f259010afb4-WcVdOr","type":"image/jpeg","width":100,"height":100,"frames":1}},"board":{"board_id":1146189,"user_id":394332,"title":"创新的力量","description":"","category_id":null,"seq":6,"pin_count":1,"follow_count":0,"created_at":1340276719,"updated_at":1340276725,"is_private":0}},{"pin_id":8447272,"user_id":444560,"board_id":1146190,"file_id":2064511,"file":{"farm":"farm1","bucket":"hbimg","key":"aa4fab086fe5887299cf17df48a250f9df25e375c95b-M4izBs","type":"image/jpeg","width":440,"height":566,"frames":1},"media_type":0,"source":"weibo.com","link":"http://weibo.com/2596178104/ycTQfusRg","raw_text":"紫罗兰的致色原因：#翡翠知识普及#（61) 一般认为由于原生翡翠矿中含有微量的锰元素所致,由于锰元素的多寡和其他微量元素如铁等的渗入程度不同,其紫色也有浓淡深浅的剃度不同,如粉紫,茄紫,篮紫多种紫罗兰.十春九木,由于翡翠矿石含有锰是一种概率事件,所以紫色翡翠相对数量是很少的,再加上种水好则更少.","text_meta":{"tags":

....

貌似我也遇到了同样的问题，你看看这个页面能不能模拟post提交数据地址是http://mixiaba.com/diy/iphoneok.asp?sid=null&pov=5

楼上，你是在向qq空间模拟提交数据吧，这个没有问题，不难实现。

但关键是我说的这个首页，别说提交数据，就是连最基本的页面都打不开，post数据的页面也一样，这就是在太奇怪了，好像这个网站所有页面都经过了特殊处理。

抓包是能抓到数据，4楼提供的那些数据，是可以抓到，但这些不可见啊。和浏览器打开的效果完全不一样啊。post数据的时候，直接返回，说这个页面不存在。

我想问一下楼上，照你这么说，搜索引擎还无法抓到快照内容了，你在baidu，google，soso上site一下花瓣，看看有没有静态的可见的显示？都有清楚的显示！！！！

按理说，本地浏览器可见，那么就应该有一种远程可见的方法。

在浏览器上做截图，并不存在技术上的问题

搞清楚，搜索引擎是截图，快照是截图，是图片？你site一下再说撒

我想知道，搜索引擎是怎么抓到内容的，既然搜索引擎能抓到，按说就应该有方法

我还没仔细的去看过花瓣的代码,不过如果我发的内容是首页的内容(应该就是,要不然要读那些做啥),那么基本上就应该是我说的样子.至于你说百度,谷歌之类的,有什么可比性吗?每年多少优秀的程序员去了?是不是他们去了也在用curl做爬虫呢?人家截图就一定是用curl抓首页代码...如果你要这么认为我也真没啥好说的.

我想问一下楼上，照你这么说，搜索引擎还无法抓到快照内容了，你在baidu，google，soso上site一下花瓣，看看有没有静态的可见的显示？都有清楚的显示！！！！

按理说，本地浏览器可见，那么就应该有一种远程可见的方法。

本来想进来耍个LM的....

现在正经回答一下12楼,
搜索引擎抓到的也是数据,html/js/css/json,
包括4楼给你的东西, 具体的页面是在浏览器端分析生成的,

至于你说google他们怎么生成快照....google有自己的浏览器,你觉得他们把抓到的html/js/css解析成页面会是什么难题吗?

一样的,如果需要,你也可以用抓到的js/html/css等生成页面,不过仅仅curl是不够的

凡事总有个解决的办法，大道理没用。
现在就剩下在线登录还没有搞定，提交不了数据

已搞定，谢谢大家

怎么搞定的？我也遇到你这个同样的问题，是啥回事啊

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

繼續使用PHP：耐力的原因Apr 19, 2025 am 12:23 AM

PHP仍然流行的原因是其易用性、靈活性和強大的生態系統。 1)易用性和簡單語法使其成為初學者的首選。 2)與web開發緊密結合，處理HTTP請求和數據庫交互出色。 3)龐大的生態系統提供了豐富的工具和庫。 4)活躍的社區和開源性質使其適應新需求和技術趨勢。

PHP和Python：探索他們的相似性和差異Apr 19, 2025 am 12:21 AM

PHP和Python都是高層次的編程語言，廣泛應用於Web開發、數據處理和自動化任務。 1.PHP常用於構建動態網站和內容管理系統，而Python常用於構建Web框架和數據科學。 2.PHP使用echo輸出內容，Python使用print。 3.兩者都支持面向對象編程，但語法和關鍵字不同。 4.PHP支持弱類型轉換，Python則更嚴格。 5.PHP性能優化包括使用OPcache和異步編程，Python則使用cProfile和異步編程。

PHP和Python：解釋了不同的範例Apr 18, 2025 am 12:26 AM

PHP主要是過程式編程，但也支持面向對象編程（OOP）；Python支持多種範式，包括OOP、函數式和過程式編程。 PHP適合web開發，Python適用於多種應用，如數據分析和機器學習。

PHP和Python：深入了解他們的歷史Apr 18, 2025 am 12:25 AM

PHP起源於1994年，由RasmusLerdorf開發，最初用於跟踪網站訪問者，逐漸演變為服務器端腳本語言，廣泛應用於網頁開發。 Python由GuidovanRossum於1980年代末開發，1991年首次發布，強調代碼可讀性和簡潔性，適用於科學計算、數據分析等領域。

在PHP和Python之間進行選擇：指南Apr 18, 2025 am 12:24 AM

PHP適合網頁開發和快速原型開發，Python適用於數據科學和機器學習。 1.PHP用於動態網頁開發，語法簡單，適合快速開發。 2.Python語法簡潔，適用於多領域，庫生態系統強大。

PHP和框架：現代化語言Apr 18, 2025 am 12:14 AM

PHP在現代化進程中仍然重要，因為它支持大量網站和應用，並通過框架適應開發需求。 1.PHP7提升了性能並引入了新功能。 2.現代框架如Laravel、Symfony和CodeIgniter簡化開發，提高代碼質量。 3.性能優化和最佳實踐進一步提升應用效率。

PHP的影響：網絡開發及以後Apr 18, 2025 am 12:10 AM

PHPhassignificantlyimpactedwebdevelopmentandextendsbeyondit.1)ItpowersmajorplatformslikeWordPressandexcelsindatabaseinteractions.2)PHP'sadaptabilityallowsittoscaleforlargeapplicationsusingframeworkslikeLaravel.3)Beyondweb,PHPisusedincommand-linescrip

PHP類型提示如何起作用，包括標量類型，返回類型，聯合類型和無效類型？Apr 17, 2025 am 12:25 AM

PHP類型提示提升代碼質量和可讀性。 1)標量類型提示：自PHP7.0起，允許在函數參數中指定基本數據類型，如int、float等。 2)返回類型提示：確保函數返回值類型的一致性。 3)聯合類型提示：自PHP8.0起，允許在函數參數或返回值中指定多個類型。 4)可空類型提示：允許包含null值，處理可能返回空值的函數。

See all articles