SearchEngine
学术科技 · 当前来自首页固化板块目录。
RT 中英文均可 本人入门级 不知道看看啥书好 谢谢
初学者,希望能和大家一起学习。。。
使用heritrix1.14.4 爬任意网页都瞬间完成任务,没有产生结果文件。可能是什么原因?heritrix设置问题,还是heritrix代码编译问题?
比较奇怪 【 在 shannondeng (shannondeng) 的大作中提到: 】 : [upload=1][/upload][upload=2][/upload]
“科技创新,方法先行”。为响应科技部“十二五”关于加强科技资源共享的号召,中科院自动化所“自动化学科创新思想与科学方法研究(课题编号:2009IM020300)”课题 与国内专业的科研数据共享平台-数据堂 网站展开全面合作,将自动化学科数字化知服务网络平台的部分后台数据,以及项目中的一些其他数据资源,免费提供给自然语言…
搜索引擎中 倒排索引下表: 左侧的索引表如何建立? 可能有人不假思索回答:左侧的索引当然要采取hash结构啊,这样可以快速的定位到字典项。但是这样问题又来了,hash函数如何选取呢?而且hash是有碰撞的,但是倒排表似乎又是不允许碰撞的存在的。事实上,虽然倒排表和hash异常的相思,但是两者还是有很大区别的,其实在这里…
问题如图所示,一点头绪都没有。个人对java也不大熟。唉。。。
对于网页源代码中的一段如: <li> <a href="http://www.hudong.com/categorypage/show/%E8%87%AA%E7%84%B6/prd=fenleishequ_zifenlei">自然</a> </li> 如何进行正则的匹配拿到自然两个字呢? 谢谢大家了
前几天去一家小的搜索公司面试,技术过关,但boss说俺没有互联网的经验,让我写个:搜索引擎广告技术的调研报告,baidu、google后还是没有思路,借人气让版上的兄弟姐们给指点下,小的不胜感激!! ps:至今还没拿到offer,很珍惜这个机会,多谢
今天看到g+提示,点开之后就reset了 求解
这学期的研究生课程 好像有3个作业,怎么交给老师?电子版发到邮箱还是纸质版送到老师手上? 期末考试范围、形式? 万分感谢啊!
我的程序从一个list<URL>中获得url,经过抓取和过滤后得到信息模块,将信息输出到数据库中。现在我想采用map-reduce方法来改进效率。设想是在hadoop的多个节点上分布式抓取和分析过滤数据,并将结果分布的直接输入到数据库中去。 请知道的学长们能说一下大体的方法,有码更好。尤其是setInputFormat…
求助。。。 或者,有研究搜索引擎的老师都有谁呀?
我想知道百度知道也就是百度问答那块,是自然收录还是有什么特别的技巧?
请问下,在做数据挖掘分析方面,有什么好用的软件工具呢,求推荐,谢谢