BBYR Achieve
返回首页
版面

SearchEngine

学术科技 · 当前来自首页固化板块目录。

1560
本版帖子
镜像[求助]为一个文本文件建立一个检索服务器和客户端.

为一个文本文件 ( 4G左右, 格式为每行长度约为100个汉字的文本)建立一个这个文件的检索服务器和客户端. 服务器功能: 接受检索请求, 找出出现输入query的文本行, 然后按相关性从高到低排序输出前30个相关性最高的行 客户端功能: 发送检索请求, 接收查询结果, 并且显示 相关性计算方法: 以词为单击进行计算 …

magicbupt2012/5/4SearchEngine最后回复 2012/5/24· Kinnari
6
镜像求助:lucene image retrieval

刚入门,有没有这方面的前辈可以指导一二啊,不胜感激! 有相关资料能发给我一份的话更好![ema39]邮箱:xiaotuzi1218@163.com

jiaoyi2012/4/7SearchEngine最后回复 2012/4/12· jiaoyi
3
镜像[求指导] 想做个网络爬虫之类的东西从byr论坛抓取想要的帖子

该怎么入手呢? byr论坛有没有提供相应的API? 或者通过其它方式利用现有的爬虫进行抓取? 求好人解答。。[ema23]

souxunzhe2012/3/31SearchEngine最后回复 2012/4/12· Forest0579
19
镜像我们学校哪个实验室研究搜索引擎方向
didotee2010/10/8SearchEngine最后回复 2012/4/12· Forest0579
6
镜像菜鸟求助:ubuntu下nutch抓取的数据如何导入MySQL中

菜鸟求助:ubuntu下nutch抓取的数据如何导入MySQL中,求高人指点。还是就是nutch抓出来的数据是2进制的,如何才能让这些2进制数据变成纯文本模式!谢谢大家啦

loujiazuo2012/3/24SearchEngine最后回复 2012/3/30· Intery89
3
镜像版内有人折腾Hadoop和Hbase的么?

求交流求联系方式,英文的书着实看起来很慢,需要向大家学习交流,感觉这样才能提高得快一些

kaka2w2011/12/31SearchEngine最后回复 2012/3/29· albert32
1
镜像【求助】nutch运行crawl错误!!

错误信息如下: crawl started in: crawl-20110914091751 rootUrlDir = urls threads = 10 depth = 3 indexer=lucene topN = 50 Injector: starting at 2011-09-14 09:17:51 Injec…

lovesai2011/9/14SearchEngine最后回复 2012/3/28· ewww2006
4
镜像GoogleCamp2012年春季招新开始啦!

北邮Google Camp开始招新了! GC简介 北京邮电大学Google Camp是2006年由李开复老师主持建立的。 北邮Google Camp是Google精神在校园里的延伸,是Google与高校学生之间重要的沟通渠道;由Google资助,由学生自己组织和管理的团体;为传达Google的精神和价值观,而组织有创意…

googlecamp2012/3/20SearchEngine最后回复 2012/3/27· vwasabi
7
镜像请教一下怎么学习搜索引擎技术啊?

在下小白一个,最近突然对搜索技术感兴趣。大致了解一点搜索引擎的原理。感觉搜索这方面的书不多呀,请教各位大大该怎么入门呢?另外,我有在看《自己动手写网络爬虫》,照抄了一下书上的代码,感觉HttpClient的API变化不小呀,最新的版本中一些方法名和位置都和书上写的不一样了。只能跑去爬API的说明文档么,所以想请大大们赐…

ForAlice2012/3/19SearchEngine最后回复 2012/3/21· ForAlice
1
镜像【求助】有没有人会在hadoop上安装kerberos

毕设做hadoop环境搭了两天都没有搭起来,有没有会这个东西。交流一下,拜托…………急啊

youyou082012/3/14SearchEngine最后回复 2012/3/18· youyou08
2
镜像百度怎么抓取到页面中隐藏内容的?而且摘要和快照不同?

比如这个例子。 这是原网页页面,隐藏,要论坛币购买后才显示115下载地址: http://t1.qpic.cn/mblogpic/c94cafdf00acfb66ceec/2000.jpg 购买之后才显示: http://t4.qpic.cn/mblogpic/a0f7a7de01761a65e46e/2000.jpg…

Tag2012/3/9SearchEngine最后回复 2012/3/10· zzcc
5
镜像牛人请进

http://blog.163.com/kinamagazine@126/blog/static/145023261201062454248261/ 这是网易一篇博文,用浏览器打开可以看见评论,但是查看网页源代码又没有评论。利用HttpClient模拟获取网页脚本同样拿不到评论。很急,请知道的讲一下原理。

zhihao2012/3/9SearchEngine最后回复 2012/3/9· zzcc
3
镜像cygwin搞不定啊。。。求救。。。

如图所示情况 一直解决不了

sacrificeBYR2012/2/24SearchEngine最后回复 2012/2/25· sacrificeBYR
5
镜像想做测试 ,哪里有HTML 的数据集

我现在想找一个 HTML 的数据集 ,即 原始的网页 ,包括html 标签的 , 最好是UTF-8 编码 ,中文的 有哪位 知道哪里可以下载

fuxiang902012/2/23SearchEngine最后回复 2012/2/23· fuxiang90
2
镜像请问用lucene,不用爬虫,可以用什么数据集模拟数据呢

rt多谢了

lm3121776972012/2/21SearchEngine最后回复 2012/2/22· yjhuang
3