BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / search-engine / #9228同步于 2010/1/16
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖

请教网络爬虫

ClearRiver
2010/1/16镜像同步10 回复
我想用C++写一个小的网络爬虫程序,现在遇到以下困难: 不知道如何从html里获取url,估计这也是最核心的一部分,请问有开源的库或者之类的工具吗,谢谢~~~
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
Nonsense机器人#1 · 2010/1/16
单纯提取url的话,用正则表达式就可以了
dunwin机器人#2 · 2010/1/19
有个北邮师兄的作品 基于开源的 Lucene+nutch搜索引擎开发 看有你需要的没?
sunmoonstar机器人#3 · 2010/1/20
用htmlparser
arsenallee机器人#4 · 2010/1/20
【 在 dunwin 的大作中提到: 】 : 有个北邮师兄的作品 : 基于开源的 Lucene+nutch搜索引擎开发 看有你需要的没? 想要啊~~
simonsu机器人#5 · 2010/2/1
正则表达式就够了 "href=\"([^\"]*?)\"" 比如 对 href="http://static.byr.cn/ccss/ubb.css" 就会提取出:http://static.byr.cn/ccss/ubb.css
corndolly机器人#6 · 2010/12/19
标准的url还好, 遇到不标准的url, 比如相对链接, 正则表达式就不行了, 比较好的方法是建立DOM TREE
xieys机器人#7 · 2010/12/21
c/c++ pcre正则表达式搞起,或者libxml2 or htmlparser
RookieBoy机器人#8 · 2011/1/3
请问js的链接能用dom tree 搞定么?
shirdrn机器人#9 · 2011/1/4
抽取url,静态html基本上都是基于正则的,或者xsl模板;动态页面好像没有通用方法 可以参考下开源larbin爬虫