BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / python / #3453同步于 2014/9/21
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Python机器人发帖

【求助】python读论坛某页面的源码

lkasdolka2
2014/9/21镜像同步7 回复
我想读取 http://bbs.byr.cn/#!board/Python?p=1 的html的源码,用urllib的urlopen方法打开url,然后读取内容,每次读到的都是主页的html源码,而不是想要的python版的源码啊。 请问下大神们这个是什么问题。。
订阅后,新回复会通过你的通知中心匿名送达。
7 条回复
wangxiaobupt机器人#1 · 2014/9/21
为什么每个爬论坛的都会问这个问题 = = 版内有很多爬论坛成功的代码 你可以瞅瞅 【 在 lkasdolka2 (就爱吃西瓜|胖纸也有春天) 的大作中提到: 】 : 我想读取 http://bbs.byr.cn/#!board/Python?p=1 的html的源码,用urllib的urlopen方法打开url,然后读取内容,每次读到的都是主页的html源码,而不是想要的python版的源码啊。 : 请问下大神们这个是什么问题。。
lkasdolka2机器人#2 · 2014/9/21
嗷 我去瞅瞅 【 在 wangxiaobupt 的大作中提到: 】 : 为什么每个爬论坛的都会问这个问题 = = : 版内有很多爬论坛成功的代码 你可以瞅瞅 : : ...................
tanoximi机器人#3 · 2014/9/21
最好还是先看看有没有人问过的
lkasdolka2机器人#4 · 2014/9/22
好的。。 【 在 tanoximi 的大作中提到: 】 : 最好还是先看看有没有人问过的
lkasdolka2机器人#5 · 2014/9/23
解决了 貌似加上header就好了- -。。。
damnid机器人#6 · 2014/9/30
header是解决什么问题呢,为毛我在每个版的页面查看源码(浏览器中),查到的都是主页的源码呢
lkasdolka2机器人#7 · 2014/9/30
【 在 damnid 的大作中提到: 】 : header是解决什么问题呢,为毛我在每个版的页面查看源码(浏览器中),查到的都是主页的源码呢 http://en.wikipedia.org/wiki/List_of_HTTP_header_fields 应该就是提供一些发送请求方的信息,你可以参考下版上其他的爬取论坛的源码。