BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #6162同步于 2010/1/29
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖

每天陪伴你的人工智能--拼音输入法

coolwc
2010/1/29镜像同步23 回复
拼音输入法整句变换的步骤: 拼音切分--(纠错 补全 简拼 模糊音)--拼音组合---候选词---ngram模型---计算结果排序 候选词的选取是依赖词库 ngram模型的建立步骤:语料---切词----统计词频和bigram trigram数据---(平滑) 后续会召集大家一起做一个简单的输入法 先开个贴占个位置
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
PtwCJ机器人#1 · 2010/1/29
在公司无法加精,恨~~ 我要参加
coolwc机器人#2 · 2010/1/29
第一步 拼音切分 详见帖子 http://bbs.byr.cn/article/CPP/35480
river机器人#3 · 2010/1/29
支持鼓励提倡
zzh机器人#4 · 2010/1/30
赞~~
Sophie8746机器人#5 · 2010/1/30
更恨,刚到家,8键是坏了的,拿命都加不了啊。。。 【 在 PtwCJ (鲜的每日C|女共产党员的男朋友) 的大作中提到: 】 : 在公司无法加精,恨~~ : 我要参加
coolwc机器人#6 · 2010/2/1
恨。。。周末泡温泉 啥也没干
simonsu机器人#7 · 2010/2/1
在家天天游戏的顶一下~
coolwc机器人#8 · 2010/2/2
今晚说一下大概计划
coolwc机器人#9 · 2010/2/2
要做一个输入法的步骤: 首先要有词库 这一步就非常的难 词条的好坏将影响输入法的质量 一般来说桌面输入法的基本词库在10-30万左右 搜狗云输入法有300万词库 切词系统 主要是用来处理语料训练语言模型的时候要用的 切分系统的切分粒度会影响到语言模型的稀疏程度 注音 要把词库注音也是个挺麻烦的工作 因为有大量的多音字 最好的注音系统能够识别出95%以上的多音字 但是我们目前还是用人工来做吧 语料库 从前大家都是用人民日报什么的 现在时代不一样了 大家都用搜索抓取的数据了 训练语言模型 这个比较简单 现在桌面输入法常用的语言模型是1元和2元 搜狗云输入法和谷歌输入法用了3元模型 3元当然是好 但是会导致数据文件过大 并且稀疏比较厉害 这次我们一起做输入法是实验性质 所以在语言模型上下点功夫 用1-3元模型来做 效果会很好 最后形成的东西应该是 这样子的 字典文件+输入法算法程序+前端界面 字典文件就是训练好的语言模型 替换掉就会有不同的输入法效果 到时候大家可以竞赛一下 看看谁的效果好一点 【 在 coolwc (小包) 的大作中提到: 】 : 今晚说一下大概计划