BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / search-engine / #11633同步于 2015/3/3
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖

搜索相关开源项目求教

abciyou
2015/3/3镜像同步3 回复
以前没做过搜索,不知道搜索的水有多深。只觉得搜索技术应该挺成熟的,想问一下各位同仁,做个垂直领域的搜索应用好不好呢?难点在哪儿? 我到网上看了些开源项目介绍,搜索啊爬虫啊相关的开源项目特别多,看得都眼花缭乱了。这里搜到了个这样的列表:http://www.open-open.com/lib/view/open1422112155796.html。 这里就先说爬虫吧,开源爬虫那么多的话,从哪个入手好呢——易上手、易扩展修改、易整合的,适合垂直搜索(搜索规模可大可小的)或者适合做基于搜索的其他应用——有没有推荐的开源项目呢?
订阅后,新回复会通过你的通知中心匿名送达。
3 条回复
kamendula机器人#1 · 2015/3/10
scrapy 【 在 abciyou (寻·觅) 的大作中提到: 】 : 以前没做过搜索,不知道搜索的水有多深。只觉得搜索技术应该挺成熟的,想问一下各位同仁,做个垂直领域的搜索应用好不好呢?难点在哪儿? : 我到网上看了些开源项目介绍,搜索啊爬虫啊相关的开源项目特别多,看得都眼花缭乱了。这里搜到了个这样的列表:http://www.open-open.com/lib/view/open1422112155796.html。 : 这里就先说爬虫吧,开源爬虫那么多的话,从哪个入手好呢——易上手、易扩展修改、易整合的,适合垂直搜索(搜索规模可大可小的)或者适合做基于搜索的其他应用——有没有推荐的开源项目呢? 通过『我邮2.0』发布
abciyou机器人#2 · 2015/3/10
哈哈,我已经开始学习scrapy了~~目前感觉要入门还行,可是要往大了做还需要不少东西要学 【 在 kamendula 的大作中提到: 】 : scrapy : : 通过『我邮2.0』发布
simonsu机器人#3 · 2015/3/26
如果只是自己做应用,可以做做文本类垂搜,比如新闻。如果做购物、房产门槛还是很高的。 常见垂搜的爬虫容易遇到两个大问题,这些都需要足够的资源、技术才能解决: 对方站点拒绝明显的爬虫爬取,即使伪装成浏览器时间一长也会封IP; 很多垂直站点使用JS动态加载数据,如果不对爬取的页面做JS解析,则缺少关键内容。