返回信息流拼音输入法整句变换的步骤:
拼音切分--(纠错 补全 简拼 模糊音)--拼音组合---候选词---ngram模型---计算结果排序
候选词的选取是依赖词库
ngram模型的建立步骤:语料---切词----统计词频和bigram trigram数据---(平滑)
后续会召集大家一起做一个简单的输入法 先开个贴占个位置
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #6162同步于 2010/1/29
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
每天陪伴你的人工智能--拼音输入法
coolwc
2010/1/29镜像同步23 回复
订阅后,新回复会通过你的通知中心匿名送达。
9 条回复
更恨,刚到家,8键是坏了的,拿命都加不了啊。。。
【 在 PtwCJ (鲜的每日C|女共产党员的男朋友) 的大作中提到: 】
: 在公司无法加精,恨~~
: 我要参加
要做一个输入法的步骤:
首先要有词库 这一步就非常的难 词条的好坏将影响输入法的质量 一般来说桌面输入法的基本词库在10-30万左右 搜狗云输入法有300万词库
切词系统 主要是用来处理语料训练语言模型的时候要用的 切分系统的切分粒度会影响到语言模型的稀疏程度
注音 要把词库注音也是个挺麻烦的工作 因为有大量的多音字 最好的注音系统能够识别出95%以上的多音字 但是我们目前还是用人工来做吧
语料库 从前大家都是用人民日报什么的 现在时代不一样了 大家都用搜索抓取的数据了
训练语言模型 这个比较简单 现在桌面输入法常用的语言模型是1元和2元 搜狗云输入法和谷歌输入法用了3元模型 3元当然是好 但是会导致数据文件过大 并且稀疏比较厉害 这次我们一起做输入法是实验性质 所以在语言模型上下点功夫 用1-3元模型来做 效果会很好
最后形成的东西应该是 这样子的 字典文件+输入法算法程序+前端界面
字典文件就是训练好的语言模型 替换掉就会有不同的输入法效果 到时候大家可以竞赛一下 看看谁的效果好一点
【 在 coolwc (小包) 的大作中提到: 】
: 今晚说一下大概计划