返回信息流以前没做过搜索,不知道搜索的水有多深。只觉得搜索技术应该挺成熟的,想问一下各位同仁,做个垂直领域的搜索应用好不好呢?难点在哪儿?
我到网上看了些开源项目介绍,搜索啊爬虫啊相关的开源项目特别多,看得都眼花缭乱了。这里搜到了个这样的列表:http://www.open-open.com/lib/view/open1422112155796.html。
这里就先说爬虫吧,开源爬虫那么多的话,从哪个入手好呢——易上手、易扩展修改、易整合的,适合垂直搜索(搜索规模可大可小的)或者适合做基于搜索的其他应用——有没有推荐的开源项目呢?
这是一条镜像帖。来源:北邮人论坛 / search-engine / #11633同步于 2015/3/3
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖
搜索相关开源项目求教
abciyou
2015/3/3镜像同步3 回复
订阅后,新回复会通过你的通知中心匿名送达。
3 条回复
scrapy
【 在 abciyou (寻·觅) 的大作中提到: 】
: 以前没做过搜索,不知道搜索的水有多深。只觉得搜索技术应该挺成熟的,想问一下各位同仁,做个垂直领域的搜索应用好不好呢?难点在哪儿?
: 我到网上看了些开源项目介绍,搜索啊爬虫啊相关的开源项目特别多,看得都眼花缭乱了。这里搜到了个这样的列表:http://www.open-open.com/lib/view/open1422112155796.html。
: 这里就先说爬虫吧,开源爬虫那么多的话,从哪个入手好呢——易上手、易扩展修改、易整合的,适合垂直搜索(搜索规模可大可小的)或者适合做基于搜索的其他应用——有没有推荐的开源项目呢?
通过『我邮2.0』发布
哈哈,我已经开始学习scrapy了~~目前感觉要入门还行,可是要往大了做还需要不少东西要学
【 在 kamendula 的大作中提到: 】
: scrapy
:
: 通过『我邮2.0』发布
如果只是自己做应用,可以做做文本类垂搜,比如新闻。如果做购物、房产门槛还是很高的。
常见垂搜的爬虫容易遇到两个大问题,这些都需要足够的资源、技术才能解决:
对方站点拒绝明显的爬虫爬取,即使伪装成浏览器时间一长也会封IP;
很多垂直站点使用JS动态加载数据,如果不对爬取的页面做JS解析,则缺少关键内容。