返回信息流我的程序从一个list<URL>中获得url,经过抓取和过滤后得到信息模块,将信息输出到数据库中。现在我想采用map-reduce方法来改进效率。设想是在hadoop的多个节点上分布式抓取和分析过滤数据,并将结果分布的直接输入到数据库中去。
请知道的学长们能说一下大体的方法,有码更好。尤其是setInputFormat和setOutputFormat方面。
这是一条镜像帖。来源:北邮人论坛 / search-engine / #10817同步于 2011/11/18
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖
求助 将抓取和分析程序改为hadoop的map-reduce
mxlwd168
2011/11/18镜像同步1 回复
订阅后,新回复会通过你的通知中心匿名送达。
1 条回复