SearchEngine
学术科技 · 当前来自首页固化板块目录。
Google这帮工程师实在太有爱了... 表示对这种毫不掩饰的卖萌毫无抵抗力啊。 选择最后的小怪物后会有惊喜呵... http://www.google.com.hk
万能的北邮技术人员,别hold了,速度来相助吧。。。 现求助如下:公司现在准备搭建知识库,将业务知识、业务准则等归类沉淀,方便查找学习。所以要搞个知识库。 项目前段时间跟一家厂商一直合作,不过搞的搜索引擎效果实在不怎么样,搜的效果一直很一般,所以想询问一下有没有哪家公司可以帮忙优化下。 1、帮忙咨询修改、优化,我们公司…
同学们大家好!北邮Google Camp开始招新了! 北京邮电大学Google Camp是2006年由李开复老师主持建立的。今年已经是第六届了。 北邮Google Camp是Google精神在校园里的延伸,是Google与高校学生之间重要的沟通渠道;由Google资助,由学生自己组织和管理的团体;为传达Google的精…
想用正则匹配抓一段新浪新闻的html码,好进一步提取。 <span id="news_con_1"> <!-- 20090309 地域上海 end --> <div class="mdlist" id="newsListTop"> <ul class="list_009" id="impoLisTop"> <!--每行…
想实现个功能:先将各种物品的数据存储到一个装置里面,然后根据用户输入的关键字搜索相关物品的信息,提取出来并显示到装置的窗口。请问大概需要去看哪些方面的资料,要用到什么知识,比如数据存储用什么结构好?搜索引擎部分用sphinx或lucene合适吗?哪个更合适些?各位有什么经验心得的吗?
请教下各位大牛们,我现在要做一部分工作就是在已知url情况下,解析一个网页,抽取出其中的文本内容,再进行分词处理,统计词频问题,这个大概如何下手,我查资料看是网络爬虫,它能解决这个问题吗? ps:菜鸟在这方面没有一点基础,想用c/c++编写,望提供下方法及思路
不知道那位有比较全面的停用词表。不知道能不能共享一下。谢谢!
RT, 顺便请教下各位大牛,现在主流的公司都是用什么语言和技术呢? 欢迎站内!!
设计一个系统,存放URL,IP,访问时间。数据量达到1000亿条记录 1)指定访问时间段,对于给定的URL,统计该URL访问量。 2)指定访问时间段,对于给定的IP,统计该IP的访问量 很想知道具体该如何设计,求教牛人。。。像这种海量数据的题见过不少了,可是一直不知道怎么做。。
想请教一下大牛
nutch是1.2版本的,tomcat是7.0.12,在tomcat中搜索结果为0,网上查了查,配置什么的都是对的,哪位大牛给个解决办法? 另,如何用lucene查看爬下来的数据?推荐一些文章吧,谢谢各位~
现在搜索的话,不想用流氓百度,bing的能力太次,搜不到东西,google还好,但是经常抽风,尤其是搜索些政府性质的词语,立马就服务器不稳定,无法连接。 有没有比较好的突破限制使用google的方法,那个,xx功发的垃圾邮件里面什么什么门的软件,有没有用?
如何防止自己网站被google或百度等搜索引擎爬虫,就像人人网,facebook一样?
大家好,现在写论文做实验,需要微博的数据集,谁知道在哪里可以找到吗?求教!谢谢