返回信息流我想用C++写一个小的网络爬虫程序,现在遇到以下困难:
不知道如何从html里获取url,估计这也是最核心的一部分,请问有开源的库或者之类的工具吗,谢谢~~~
这是一条镜像帖。来源:北邮人论坛 / search-engine / #9228同步于 2010/1/16
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖
请教网络爬虫
ClearRiver
2010/1/16镜像同步10 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
【 在 dunwin 的大作中提到: 】
: 有个北邮师兄的作品
: 基于开源的 Lucene+nutch搜索引擎开发 看有你需要的没?
想要啊~~
正则表达式就够了
"href=\"([^\"]*?)\""
比如 对 href="http://static.byr.cn/ccss/ubb.css"
就会提取出:http://static.byr.cn/ccss/ubb.css