BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / python / #16608同步于 2016/11/22
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖

python如何爬取新浪微博

suninthesky
2016/11/22镜像同步59 回复
最近对爬虫特别感兴趣,想要爬取新浪微博,PC端的网页源码特别乱,和常规的不一样,之前看极客学院的教程说爬手机版的微博,因为它的网页源码不乱,这几天看手机微博的源码,又变乱了,而且增加了验证码,,小白一枚,实在不知道该咋整,求思路,求推荐教程~
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
Ncer机器人#1 · 2016/11/22
m.weibo.cn
chinapds机器人#2 · 2016/11/22
你应该关注一下,为什么不能直接爬,然后都有哪些方案能够解决问题
quietcool机器人#3 · 2016/11/22
一个偏见:感觉 py 的优雅都被一堆爬虫党毁了……
colorest机器人#4 · 2016/11/22
注册个微博开发者账号,去看看API呗。。
wangxiaobupt机器人#5 · 2016/11/22
同意板凳 【 在 suninthesky 的大作中提到: 】 : 最近对爬虫特别感兴趣,想要爬取新浪微博,PC端的网页源码特别乱,和常规的不一样,之前看极客学院的教程说爬手机版的微博,因为它的网页源码不乱,这几天看手机微博的源码,又变乱了,而且增加了验证码,,小白一 : ......... 发自「贵邮」
zhuzhubupt机器人#6 · 2016/11/23
"一个偏见:感觉 py 的优雅都被一堆爬虫党毁了……" hhhhhh感觉我膝盖中了一?
rythmewoo机器人#7 · 2016/11/23
直接爬的话 爬WAP版新浪微博,也就是 m.weibo.cn 。不然就用API爬,申请一个开发者账号
hgfgood机器人#8 · 2016/11/23
比较好的是买个打码服务,自动识别验证码。可自动识别登录微博后,爬取数据都不是问题。 通过『我邮2.0』发布
dcy0701机器人#9 · 2016/11/23
python不适合现代的爬虫啊.... 目前的爬虫最多是去模拟浏览器内核,连服务器返回的js代码都无法执行,so还是自动化测试的框架适合爬虫~,毕竟是一个真正的浏览器内核,你再怎么检测,我也是个浏览器呀。。。 比如phantom