php curl get 无法抓取淘宝搜索页面,麻烦大家了。
php吧
全部回复
仅看楼主
level 3
szbhzc 楼主
看到本吧里有人发了这个问题了。
链接在这里: https://tieba.baidu.com/p/3381012362
php 使用crul 如何抓取淘宝商品页面?
测试了几次都没有成功。同样的代码,可以抓取其它购物网站的商品页面,看来淘宝页面是做了手脚了。
也百度了一些答案,但没有帮助。
例子代码如下:
$ch = curl_init();
curl_setopt($ch, CURLOPT_URL, "https://item.taobao.com/item.htm?spm=a230r.1.14.71.sEtvGB&id=521435287162&ns=1&abbucket=4#detail");
curl_setopt($ch, CURLOPT_RETURNTRANSFER, TRUE);
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, FALSE);
$header[] = "text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8";
$header[] = "Accept-Encoding: gzip, deflate";
$header[] = "Accept-Language: zh-CN";
$header[] = "Cache-Control: max-age=0";
$header[] = "Accept-Charset: ISO-8859-1,utf-8;q=0.7,*;q=0.7";
$header[] = "Connection: keep-alive";
//$header[] = "Accept-Language: zh-CN,zh;q=0.8,en;q=0.6";
//$header[] = "Cookie: isg=73B0849074EA7F14942163BAED489E51; l=ApCQTfqzJ17Da/gXOlHaSen3INDiEnSj; t=a504d557250dd67bd35762768dbc57e1; cna=LPwaDSEZwR8CATr67ElFiZp9; mt=ci%3D-1_0; thw=cn; v=0; cookie2=1ccaac47c99e290a183da147366f2630";
curl_setopt($ch, CURLOPT_USERAGENT, 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_9_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/31.0.1650.57 Safari/537.36');
curl_setopt($ch, CURLOPT_FOLLOWLOCATION, true);
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, FALSE);
//curl_setopt($ch, CURLOPT_HTTPHEADER, $header);//根据百度的结果,有人提到需要配置cookie,所以用httpwatch工具得到了GET淘宝页面时COOKIE的内容,从而构造了上面的那个cookie,但发现还是不能抓取呀,所以注释了这行;
$output = curl_exec($ch);
curl_close($ch);
根据百度的结果,有人提到需要配置cookie,所以用httpwatch工具得到了GET淘宝页面时COOKIE的内容,从而构造了上面的那个cookie,但发现还是不能抓取呀;
2015年10月06日 12点10分 1
level 3
szbhzc 楼主
原来在百度贴吧发的一个问题可能因为出现了X宝的链接被百度删除了,重新弄了一个: http://zhidao.baidu.com/question/329282393315845885.html
2015年10月06日 12点10分 2
level 5
抓取淘宝的,
工程肯定不小。
2015年10月06日 17点10分 4
没有想的那么大工程的,我只抓指定的商品页面
2015年10月06日 18点10分
level 14
可能需要伪造一些信息, 你可以用chrome调试模式看看head里面
然后在curl里面拼接
2015年10月07日 01点10分 5
我用httpwatch查看了header, 然后模仿,也不行;
2015年10月07日 07点10分
level 3
szbhzc 楼主
根据楼上一哥们的提示,设置了REFERER后可以抓取淘宝的商品页面了。
curl_setopt($ch, CURLOPT_REFERER, 'item.taobao.com');
但是还是不能得到[泪]淘宝商品页面的“首件优惠”价格呀,
2015年10月07日 08点10分 7
回复 惨叫发生器 :不是,没有用正则,把获取的页面保存下来了,得不到那个元素
2015年10月14日 04点10分
level 2
楼主有解决吗,我抓淘宝商品页面一直不成功,能帮忙给下你抓取的代码吗
2016年12月16日 12点12分 8
level 13
爬虫用Python ,urllib2+beautifulsoup妥妥的
2016年12月17日 00点12分 9
level 13
你可以这样 把他全部的head 原封不动的copy 一下。模拟试试
2016年12月17日 00点12分 10
level 9
加我解决2329291801
2016年12月17日 05点12分 11
1