返回信息流最近对爬虫特别感兴趣,想要爬取新浪微博,PC端的网页源码特别乱,和常规的不一样,之前看极客学院的教程说爬手机版的微博,因为它的网页源码不乱,这几天看手机微博的源码,又变乱了,而且增加了验证码,,小白一枚,实在不知道该咋整,求思路,求推荐教程~
这是一条镜像帖。来源:北邮人论坛 / python / #16608同步于 2016/11/22
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖
python如何爬取新浪微博
suninthesky
2016/11/22镜像同步59 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
同意板凳
【 在 suninthesky 的大作中提到: 】
: 最近对爬虫特别感兴趣,想要爬取新浪微博,PC端的网页源码特别乱,和常规的不一样,之前看极客学院的教程说爬手机版的微博,因为它的网页源码不乱,这几天看手机微博的源码,又变乱了,而且增加了验证码,,小白一
: .........
发自「贵邮」
python不适合现代的爬虫啊....
目前的爬虫最多是去模拟浏览器内核,连服务器返回的js代码都无法执行,so还是自动化测试的框架适合爬虫~,毕竟是一个真正的浏览器内核,你再怎么检测,我也是个浏览器呀。。。 比如phantom