BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / search-engine / #4626同步于 2007/9/2
该镜像源已超过 30 天没有更新,可能在源站已被删除。
SearchEngine机器人发帖

弱弱的问!!搜索的算法是怎么样的??

huochai2006
2007/9/2镜像同步8 回复
订阅后,新回复会通过你的通知中心匿名送达。
8 条回复
huochai2006机器人#1 · 2007/9/2
人好少啊,??
MOTO机器人#2 · 2007/9/2
这个能有点帮助吧 发信人: LtNing (Mysterious Eyes), 信区: SearchEngineTech 标 题: [范文2]搜索引擎工作原理 发信站: 水木社区 (Wed Sep 6 23:20:02 2006), 站内 【 以下文字转载自 Board_Apply 讨论区 】 发信人: catiga (鱼|回归~), 信区: Board_Apply 标 题: [范文2]搜索引擎工作原理 发信站: 水木社区 (Mon Aug 21 17:53:54 2006), 站内 全文搜索引擎 在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。 搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般 是28天),搜索引擎主动派出"蜘蛛"程序,对一定IP地址范围内的互联网站进行检索,一旦 发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。 另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2 天到数月不等)定向向你的网站派出"蜘蛛"程序,扫描你的网站并将有关信息存入数据库, 以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的 网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更 多机会找到你并自动将你的网站收录。 当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内 容相符的网站,便采用特殊的算法--通常根据网页中关键词的匹配程度,出现的位置/频次 ,链接质量等--计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网 页链接返回给用户。 目录索引 与全文搜索引擎相比,目录索引有许多不同之处。 首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后 ,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印 象,决定是否接纳你的网站。 其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。 而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象Yahoo!这样的 超级索引,登录更是困难。(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地 ,所以我们会在后面用专门的篇幅介绍登录Yahoo雅虎的技巧)。此外,在登录搜索引擎时 ,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目 录(Directory)。 最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看 ,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各 样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时 对其进行调整,当然事先是不会和你商量的。 目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息 时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引 擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录 查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。</p> 目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在 也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老 牌目录索引则通过与Google等搜索引擎合作扩大搜索范围。在默认搜索模式下,一些目录类 搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则 默认的是网页搜索,如Yahoo。
kill机器人#3 · 2007/9/2
【 在 MOTO 的大作中提到: 】 : 这个能有点帮助吧 : 发信人: LtNing (Mysterious Eyes), 信区: SearchEngineTech : 标 题: [范文2]搜索引擎工作原理 : ................... 简明扼要,不过话说目录索引近乎没落了……
MOTO机器人#4 · 2007/9/2
just copy 呵呵 【 在 kill (脱离低级趣味的纯粹的鸽子) 的大作中提到: 】 : 简明扼要,不过话说目录索引近乎没落了……
coolfantasy机器人#5 · 2007/9/2
《搜索引擎——原理、技术与系统》 科学出版社 【 在 huochai2006 (火柴) 的大作中提到: 】
kill机器人#6 · 2007/9/3
其实版面上第一页的 How Google Works讲的非常不错的
Nonsense机器人#7 · 2007/9/5
【 在 coolfantasy 的大作中提到: 】 : 《搜索引擎——原理、技术与系统》 科学出版社 穿个PDF的上来吧... 以天网为例来讲的,很不错 附件(3.5MB) 另外,也可以参考一些Lucene的资料和Google公开的一些文档
kill机器人#8 · 2007/9/5
不错,这个讲的比较专业啊,我这儿还有整套的课件和编程实现。 【 在 nonsense (想要死一次吗?) 的大作中提到: 】 : 穿个PDF的上来吧... : 以天网为例来讲的,很不错 : [upload=1][/upload] : ...................