BBYR Achieve
返回首页
版面

SearchEngine

学术科技 · 当前来自首页固化板块目录。

1560
本版帖子
镜像今天Google的logo太可爱了,被萌到了

Google这帮工程师实在太有爱了... 表示对这种毫不掩饰的卖萌毫无抵抗力啊。 选择最后的小怪物后会有惊喜呵... http://www.google.com.hk

simonsu2011/9/24SearchEngine最后回复 2011/11/2· wflovest
1
镜像请问BAIDU,GOOGLE是如何防范机器人查询搜索的呢,也不用输入验
brandy2011/8/30SearchEngine最后回复 2011/10/10· liujianliuku
4
镜像【搜索引擎】求助:知识库搜索引擎优化

万能的北邮技术人员,别hold了,速度来相助吧。。。 现求助如下:公司现在准备搭建知识库,将业务知识、业务准则等归类沉淀,方便查找学习。所以要搞个知识库。 项目前段时间跟一家厂商一直合作,不过搞的搜索引擎效果实在不怎么样,搜的效果一直很一般,所以想询问一下有没有哪家公司可以帮忙优化下。 1、帮忙咨询修改、优化,我们公司…

buptren2011/8/18SearchEngine最后回复 2011/10/10· liujianliuku
5
镜像[谷粉集结号]2011 北邮 Google Camp 招新啦!

同学们大家好!北邮Google Camp开始招新了! 北京邮电大学Google Camp是2006年由李开复老师主持建立的。今年已经是第六届了。 北邮Google Camp是Google精神在校园里的延伸,是Google与高校学生之间重要的沟通渠道;由Google资助,由学生自己组织和管理的团体;为传达Google的精…

googlecamp2011/9/23SearchEngine最后回复 2011/9/29· googlecamp
7
镜像匹配新浪新闻

想用正则匹配抓一段新浪新闻的html码,好进一步提取。 <span id="news_con_1"> <!-- 20090309 地域上海 end --> <div class="mdlist" id="newsListTop"> <ul class="list_009" id="impoLisTop"> <!--每行…

fenixlee5202011/8/18SearchEngine最后回复 2011/9/26· simonsu
4
镜像新手求教

想实现个功能:先将各种物品的数据存储到一个装置里面,然后根据用户输入的关键字搜索相关物品的信息,提取出来并显示到装置的窗口。请问大概需要去看哪些方面的资料,要用到什么知识,比如数据存储用什么结构好?搜索引擎部分用sphinx或lucene合适吗?哪个更合适些?各位有什么经验心得的吗?

cdy37182011/9/16SearchEngine最后回复 2011/9/26· simonsu
2
镜像网页内容提取和分词处理

请教下各位大牛们,我现在要做一部分工作就是在已知url情况下,解析一个网页,抽取出其中的文本内容,再进行分词处理,统计词频问题,这个大概如何下手,我查资料看是网络爬虫,它能解决这个问题吗? ps:菜鸟在这方面没有一点基础,想用c/c++编写,望提供下方法及思路

zhoujy2011/9/20SearchEngine最后回复 2011/9/25· liujianliuku
15
镜像求stopwords列表

不知道那位有比较全面的停用词表。不知道能不能共享一下。谢谢!

andyfeng20112011/9/24SearchEngine最后回复 2011/9/25· simonsu
1
镜像请问,想做个主题性的搜索网站,用什么语言最好?

RT, 顺便请教下各位大牛,现在主流的公司都是用什么语言和技术呢? 欢迎站内!!

yogayama2011/9/21SearchEngine最后回复 2011/9/24· simonsu
3
镜像请教个百度笔试问题,麻烦大家了。

设计一个系统,存放URL,IP,访问时间。数据量达到1000亿条记录 1)指定访问时间段,对于给定的URL,统计该URL访问量。 2)指定访问时间段,对于给定的IP,统计该IP的访问量 很想知道具体该如何设计,求教牛人。。。像这种海量数据的题见过不少了,可是一直不知道怎么做。。

likieyes2011/7/1SearchEngine最后回复 2011/9/20· JoyForce
5
镜像有研究过solr的吗?

想请教一下大牛

try2006bupt2011/9/14SearchEngine最后回复 2011/9/15· zzcc
1
镜像nutch爬下来数据之后搜索结果为0???

nutch是1.2版本的,tomcat是7.0.12,在tomcat中搜索结果为0,网上查了查,配置什么的都是对的,哪位大牛给个解决办法? 另,如何用lucene查看爬下来的数据?推荐一些文章吧,谢谢各位~

flyemirates42011/7/26SearchEngine最后回复 2011/8/29· zhhxxx
1
镜像问个关于google使用的,不知这个冷清的版上是否有答案

现在搜索的话,不想用流氓百度,bing的能力太次,搜不到东西,google还好,但是经常抽风,尤其是搜索些政府性质的词语,立马就服务器不稳定,无法连接。 有没有比较好的突破限制使用google的方法,那个,xx功发的垃圾邮件里面什么什么门的软件,有没有用?

SWK2011/8/26SearchEngine最后回复 2011/8/27· james0zan
2
镜像【请教】如何防止自己网站被爬虫

如何防止自己网站被google或百度等搜索引擎爬虫,就像人人网,facebook一样?

quanquan2011/6/20SearchEngine最后回复 2011/8/14· yanhaoran
3
镜像谁知道哪里可以找到微博的数据集

大家好,现在写论文做实验,需要微博的数据集,谁知道在哪里可以找到吗?求教!谢谢

singlala2011/4/11SearchEngine最后回复 2011/8/11· asin
1