BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / search-engine / #11277同步于 2013/3/27
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖

求一个可以查询社交网络好友关系或者关注的使用简单一点的爬虫

Recovery
2013/3/27镜像同步5 回复
如题··开源中国下了几个··不是用不了就是不会用···急求
订阅后,新回复会通过你的通知中心匿名送达。
5 条回复
Recovery机器人#1 · 2013/3/28
【 在 zhihao 的大作中提到: 】 : 不知道楼主抓的是哪个社交网站,这样的站点屏蔽比较严格。抓取信息的方法有两个:1.根据开放API去抓数据。但是会有抓取次数和抓取速度限制 : 2.自己订制爬虫,如果设计得当的话抓取速度和抓取的量会远超过第一个方法。关于爬虫,可以用Larbin进行订制,或者自己用python写,代码量大概在2000行就可以搞定。(仅实现多线程,去重解析模块这些简单功能,路过大牛勿抠字眼)希望对楼主有帮助 啊啊,非常感谢啊,我们社交网络布置的小作业,我们准备去抓人人,老师布置的只要建立自己班上的好友关系网络就行,感觉数据量不是很大;我们只会处理数据,不知道从哪抓取,不太懂上面那些编程的东西(只学过c++和matlab····),我们本来以为会有现成的直接使用的··
Recovery机器人#2 · 2013/3/28
【 在 zhihao 的大作中提到: 】 : 最好不要抓人人,开放接口做的不好,开发者经常抱怨的。去抓新浪数据吧。开放接口做的友好些。 其实我看到过一篇抓人人的,用的什么r,然后然后我下了软件复制了代码,运行就报错了,因为不懂代码,就没继续···那我去试试新浪吧,谢谢!
Wizmann机器人#3 · 2013/3/28
自己玩200行就够了。。2000行有点吓人。。。又不是工业代码。。。
Recovery机器人#4 · 2013/3/28
一点都不会编,啊啊啊啊 【 在 Wizmann 的大作中提到: 】 : 自己玩200行就够了。。2000行有点吓人。。。又不是工业代码。。。
Wizmann机器人#5 · 2013/3/28
没有真正的测试环境和数据,工程做起来比较呵呵 【 在 zhihao 的大作中提到: 】 : 写爬虫一般是为了考验架构能力和应对大数据量下的内存和数据的矛盾问题,看效率、可配置性和鲁棒性。单纯写200行爬虫玩对能力提升没啥大的帮助。