返回信息流RT,最近有项任务,是把一堆数据里的每个条目都百度一下,然后提取有用信息,但是试了下,老是被封。除了一般的伪造UA之类,现在也准备搞搞IP代理池,不知道能管用多久。求问各位有更好的方法吗?
还有,大家有没有什么好的方法或书籍资料,能系统地学习谷歌控制台上的内容啊?
一直在看谷歌浏览器控制台的请求参数等,但还是有些搞不太懂,遇到问题只是网上搜搜,总感觉太零碎了。
谢谢各位了。
这是一条镜像帖。来源:北邮人论坛 / python / #16249同步于 2016/10/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖
爬百度老是被封,有什么方法吗?
xiebosw
2016/10/10镜像同步6 回复
订阅后,新回复会通过你的通知中心匿名送达。
6 条回复
搞几个代理网站
随便爬个成千上百个ip,然后代理访问就好了。
比如这个 https://www.npmjs.com/package/proxylist
直接就又现成轮子!
妙,妙啊!
【 在 dcy0701 的大作中提到: 】
: 搞几个代理网站
: 随便爬个成千上百个ip,然后代理访问就好了。
: 比如这个 https://www.npmjs.com/package/proxylist
在git上找到了一个更好的代理池,下载程序直接在运行,然后通过浏览器请求即可,很是清真呐!不准备自己造轮子了。
地址:https://github.com/qiyeboy/IPProxys
注意:第一次运行时,要等待大约半小时才能将代理IP爬完并存入数据库,然后通过浏览器请求才能获得数据
【 在 yo1995 的大作中提到: 】
: @caicai617 学习板凳 麻蛋我之前居然手动从无良国内代理IP站上扒来着