BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / cpp / #90503同步于 2016/3/8
该镜像源已超过 30 天没有更新,可能在源站已被删除。
CPP机器人发帖

爬取一个网站的全部站内页面,怎么设计数据结构

wabyrlt
2016/3/8镜像同步28 回复
如题,以网站首页为入口,匹配出该页面内全部的站内链接,然后逐个重复上述步骤;初步想到了将链接视为节点构造图,然后深搜或广搜,但具体应该怎么建呢?请大神们给个思路,谢谢!
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
fuxuemingzhu机器人#1 · 2016/3/8
之前看到过关于抓取知乎所有文章的来着。
fuxuemingzhu机器人#2 · 2016/3/8
哦,好像是从首页进去一个用户,抓他所有好友,再爪好友的好友。。嗯
wabyrlt机器人#3 · 2016/3/8
【 在 fuxuemingzhu 的大作中提到: 】 : 哦,好像是从首页进去一个用户,抓他所有好友,再爪好友的好友。。嗯 是的,这里的好友就相当于链接;只是怎么构造这个数据结构?
yuyue9284机器人#4 · 2016/3/8
可以看看scrapy 【 在 wabyrlt 的大作中提到: 】 如题,以网站首页为入口,匹配出该页面内全部的站内链接,...
Aster机器人#5 · 2016/3/8
用python, beautifulsoup直接搞,设置个深度爬
Lights机器人#6 · 2016/3/8
lz的数据结构指是什么。。。。。。 规模不大的话直接顺着链接爬就好,深度优先嗯。。。同时记录爬到过的节点,避免绕圈。。。
wht机器人#7 · 2016/3/9
这爬虫不就是要匹配目标网站的结构么,数据结构又是什么鬼……
icybee机器人#8 · 2016/3/9
scrapy自带bloom filter去重url,并且维护一个url抓取队列,不需要知道拓扑,酱
wabyrlt机器人#9 · 2016/3/9
【 在 yuyue9284 的大作中提到: 】 : 可以看看scrapy : 如题,以网站首页为入口,匹配出该页面内全部的站内链接,... 我用的c++,不会python