SearchEngine
学术科技 · 当前来自首页固化板块目录。
先看看我的ID: 再来一张: 这是一个很有趣的应用,由Geogreeting(via LifeHacker)结合图片字符生成器及Google Maps制作而成。 你可以输入英文字符,它就会自动找出世界各地符合字符形状的建筑物,最终构成上面的这种效果图。当你指向结果中的某个建筑物,它会即时在Google Maps上显示该…
数学之美 系列十六 (下)- 不要把所有的鸡蛋放在一个篮子里 最大熵模型 2006年11月16日 上午 06:50:00 发表者:Google 研究员,吴军 我们上次谈到用最大熵模型可以将各种信息综合在一起。我们留下一个问题没有回答,就是如何构造最大熵模型。我们已经所有的最大熵模型都是指数函数的形式,现在只需要确定指数…
数学之美 系列十六(上) 不要把所有的鸡蛋放在一个篮子里 -- 谈谈最大熵模型 2006年10月8日 上午 07:27:00 发表者:Google 研究员,吴军 [我们在投资时常常讲不要把所有的鸡蛋放在一个篮子里,这样可以降低风险。在信息处理中,这个原理同样适用。在数学上,这个原理称为最大熵原理(the maximum…
数学之美 系列十五 繁与简 自然语言处理的几位精英 2006年8月23日 下午 11:22:00 发表者:吴军,Google 研究员 我在数学之美系列中一直强调的一个好方法就是简单。但是,事实上,自然语言处理中也有一些特例,比如有些学者将一个问题研究到极致,执著追求完善甚至可以说完美的程度。他们的工作对同行有很大的参考…
数学之美 十四 谈谈数学模型的重要性 2006年8月9日 上午 09:12:00 发表者:吴军,Google 研究员 [注:一直关注数学之美系列的读者可能已经发现,我们对任何问题总是在找相应的准确的数学模型。为了说明模型的重要性,今年七月份我在 Google 中国内部讲课时用了整整一堂课来讲这个问题,下面的内容是我讲座…
数学之美 系列十三 信息指纹及其应用 2006年8月3日 上午 11:17:00 发表者:吴军,Google 研究员 任何一段信息文字,都可以对应一个不太长的随机数,作为区别它和其它信息的指纹(Fingerprint)。只要算法设计的好,任何两段信息的指纹都很难重复,就如同人类的指纹一样。信息指纹在加密、信息压缩和处理…
数学之美 系列十一 - Google 阿卡 47 的制造者阿米特.辛格博士 2006年7月10日 上午 09:52:00 发表者:Google 研究员,吴军 枪迷或者看过尼古拉斯.凯奇(Nicolas Cage)主演的电影“战争之王”(Lord of War)的人也许还记得影片开头的一段话:(在所有轻武器中,)最有名的…
数学之美 系列十 有限状态机和地址识别 2006年7月5日 上午 09:09:00 发表者:吴军,Google 研究员 地址的识别和分析是本地搜索必不可少的技术,尽管有许多识别和分析地址的方法,最有效的是有限状态机。 一个有限状态机是一个特殊的有向图(参见有关图论的系列),它包括一些状态(节点)和连接这些状态的有向弧。…
数学之美 系列九 -- 如何确定网页和查询的相关性 2006年6月27日 上午 09:53:00 发表者:吴军,Google 研究员 [我们已经谈过了如何自动下载网页、如何建立索引、如何衡量网页的质量(Page Rank)。我们今天谈谈如何确定一个网页和某个查询的相关性。了解了这四个方面,一个有一定编程基础的读者应该可…
数学之美 系列八-- 贾里尼克的故事和现代语言处理 2006年6月8日 上午 09:15:00 发表者:Google 研究员,吴军 读者也许注意到了,我们在前面的系列中多次提到了贾里尼克这个名字。事实上,现代语音识别和自然语言处理确实是和它的名字是紧密联系在一起的。我想在这回的系列里,介绍贾里尼克本人。在这里我不想列举…
数学之美 系列七 -- 信息论在信息处理中的应用 2006年5月25日 上午 07:56:00 发表者:吴军, Google 研究员 我们已经介绍了信息熵,它是信息论的基础,我们这次谈谈信息论在自然语言处理中的应用。 先看看信息熵和语言模型的关系。我们在系列一中谈到语言模型时,没有讲如何定量地衡量一个语言模型的好坏,当…
数学之美系列六 -- 图论和网络爬虫 (Web Crawlers) 2006年5月15日 上午 07:15:00 发表者: 吴军,Google 研究员 [离散数学是当代数学的一个重要分支,也是计算机科学的数学基础。它包括数理逻辑、集合论、图论和近世代数四个分支。数理逻辑基于布尔运算,我们已经介绍过了。这里我们介绍图论和…
数学之美系列五 -- 简单之美:布尔代数和搜索引擎的索引 2006年5月10日 上午 09:10:00 发表者: 吴军,Google 研究员 [建立一个搜索引擎大致需要做这样几件事:自动下载尽可能多的网页;建立快速有效的索引;根据相关性对网页进行公平准确的排序。我们在介绍 Google Page Rank (网页排名)…
数学之美系列 4 -- 怎样度量信息? 2006年4月26日 上午 08:11:00 发表者:吴军,Google 研究员 前言: Google 一直以 “整合全球信息,让人人能获取,使人人能受益” 为使命。那么究竟每一条信息应该怎样度量呢? 信息是个很抽象的概念。我们常常说信息很多,或者信息较少,但却很难说清楚信息到底…
数学之美 系列三 -- 隐含马尔可夫模型在语言处理中的应用 2006年4月17日 上午 08:01:00 发表者:吴军,Google 研究员 前言:隐含马尔可夫模型是一个数学模型,到目前为之,它一直被认为是实现快速精确的语音识别系统的最成功的方法。复杂的语音识别问题通过隐含马尔可夫模型能非常简单地被表述、解决,让我不由…