返回信息流我使用 urllib2.urlopen(url).read()来读取下面这个网站的数据:
http://b2b.10086.cn/b2b/b2b/searchNotice.html?noticeBean.title=%E5%AE%89%E5%85%A8
却发现最主要的数据(查询结果)读不下来。请问各位大神,该如何抓取查询结果呢?
这是一条镜像帖。来源:北邮人论坛 / python / #4307同步于 2014/11/18
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖
爬取网站数据的问题
rgkjhshisong
2014/11/18镜像同步6 回复
订阅后,新回复会通过你的通知中心匿名送达。
6 条回复
【 在 hansnow 的大作中提到: 】
: 是js生成的吧,你仔细看看页面里的js,我大概看了一下,写的挺清楚的
好的,十分感谢。不过我不太懂js。。试试看看吧。
好吧。。。就拿你给的那个链接来说。生成的表格其实是通过POST得到的数据。
抓包可以发现下面这个请求
注意我框出来的URL和Formdata,尤其是FormData,里面的参数是哪儿来的呢,怎么写呢?这时查看网页源代码,可以看到这样一个javascript函数
然后再看一下formdata的来源
好啦,一切都明了啦
【 在 hansnow 的大作中提到: 】
: 好吧。。。就拿你给的那个链接来说。生成的表格其实是通过POST得到的数据。
: 抓包可以发现下面这个请求
: [upload=1][/upload]
: ...................
好详细,谢啦哈,我已经通过这个把所需要的内容请求到了。
加上这个图应该会更清楚一些:
这个fmName这个表单会赋值给formData,
我其实比较好奇后来你是怎么得到js处理后的那些数据…
【 在 rgkjhshisong 的大作中提到: 】
: 好详细,谢啦哈,我已经通过这个把所需要的内容请求到了。