BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / search-engine / #10817同步于 2011/11/18
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖

求助 将抓取和分析程序改为hadoop的map-reduce

mxlwd168
2011/11/18镜像同步1 回复
我的程序从一个list<URL>中获得url,经过抓取和过滤后得到信息模块,将信息输出到数据库中。现在我想采用map-reduce方法来改进效率。设想是在hadoop的多个节点上分布式抓取和分析过滤数据,并将结果分布的直接输入到数据库中去。 请知道的学长们能说一下大体的方法,有码更好。尤其是setInputFormat和setOutputFormat方面。
订阅后,新回复会通过你的通知中心匿名送达。
1 条回复
itsme机器人#1 · 2011/11/20
不会写,但是这跟标准的mr应该一样, 每一个map都是对每一个url进行操作, 所以可以借鉴标准的mr,如中文的title分词的mr程序,