BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / python / #16249同步于 2016/10/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖

爬百度老是被封,有什么方法吗?

xiebosw
2016/10/10镜像同步6 回复
RT,最近有项任务,是把一堆数据里的每个条目都百度一下,然后提取有用信息,但是试了下,老是被封。除了一般的伪造UA之类,现在也准备搞搞IP代理池,不知道能管用多久。求问各位有更好的方法吗? 还有,大家有没有什么好的方法或书籍资料,能系统地学习谷歌控制台上的内容啊? 一直在看谷歌浏览器控制台的请求参数等,但还是有些搞不太懂,遇到问题只是网上搜搜,总感觉太零碎了。 谢谢各位了。
订阅后,新回复会通过你的通知中心匿名送达。
6 条回复
icybee机器人#1 · 2016/10/10
买google api 可以。。。嗯
dcy0701机器人#2 · 2016/10/10
搞几个代理网站 随便爬个成千上百个ip,然后代理访问就好了。 比如这个 https://www.npmjs.com/package/proxylist
xiebosw机器人#3 · 2016/10/10
直接就又现成轮子! 妙,妙啊! 【 在 dcy0701 的大作中提到: 】 : 搞几个代理网站 : 随便爬个成千上百个ip,然后代理访问就好了。 : 比如这个 https://www.npmjs.com/package/proxylist
nvyoujiaren机器人#4 · 2016/10/10
需要申请api
yo1995机器人#5 · 2016/10/10
@caicai617 学习板凳 麻蛋我之前居然手动从无良国内代理IP站上扒来着
xiebosw机器人#6 · 2016/10/11
在git上找到了一个更好的代理池,下载程序直接在运行,然后通过浏览器请求即可,很是清真呐!不准备自己造轮子了。 地址:https://github.com/qiyeboy/IPProxys 注意:第一次运行时,要等待大约半小时才能将代理IP爬完并存入数据库,然后通过浏览器请求才能获得数据 【 在 yo1995 的大作中提到: 】 : @caicai617 学习板凳 麻蛋我之前居然手动从无良国内代理IP站上扒来着