SearchEngine
学术科技 · 当前来自首页固化板块目录。
过完这个暑假就大四了,泪,想出国...对web数据挖掘很感兴趣,问下有没有做相关内容的实验室...
用的是eclipse加载的Nutch,参数什么的设置好后运行总是出现以下问题,也重装了几次,无果,纠结几天了,网上也查不到解决办法 Exception in thread "main" java.io.IOException: Cannot run program "chmod": CreateProcess erro…
分享一下,07年的 附件(1.5MB)
用nutch1.2进行爬取,可是log总是显示No URLs to fetch - check your seed list and URL filters.在url列表里添加了几个网址也不行。请问怎么解决啊!小弟第一次学习有关知识,还望各位多多帮助[ema1]
打算学习搜索算法的实现以及系统实现,求各位大牛推荐一些文章或者书籍之类,不甚感激~
这是一个小项目,有工资,不用上班,完成任务就可以。有兴趣的站内我啊,我也是初次学习,可以一起做完这个任务。
有没有计算pagerank的靠谱点的程序。 有没有链接关系库? 比如 http://www.bupt.edu.cn/(假设代号为u1) 有出度: http://www.sjtu.edu.cn/ (代号为u2)、 http://bbs.stju.edu.cn/ (代号为u3)、 http://bbs.byr.edu.cn…
希望学习搜索引擎的后台核心内容,没法比如,因为还不了解,希望以后的学习尽量保持在c或c++环境中,不想学java 的搜索引擎,虽然很火也样子... 但我还是不懂,大家给点建议吧....或者一些学习心得,谢谢了.
想知道在Nutch中以插件形式(前提是不修改源码)加入中文分词组件paoding,是不是不支持检索啊???这块一直没有成功。。。。求牛人解答啊啊啊啊啊!
用什么,怎么提取的。。
刚看Quora的介绍,有这样一句话:“Quora此后逐步开放,用户通过Twitter或者Facebook帐号即可登陆,这是为了防止搜索引擎索引内容,但同时又让大众都可以参与。”非计算机专业,不懂搜索,求明白的人解释一下。多谢喔!
(1) Machines are typically dual-processor x86 processors running Linux, with 2-4 GB of memory per machine. (2) Commodity networking hardware is used – typi…
如题~~~
rt 比如说数据都存好索引好了,我要查询"byr forum",但是我想把byr的权重提升为forum 的两倍,怎么实现? 我只知道可以改doc或者field的boost值,但是这种方法好像跟我的需求不太一致。换 sort函数好像也不行…… 求教各位大牛,谢谢~