返回信息流我需要对类似于http://img02.taobaocdn.com/imgextra/i2/152408262/T2Xh5NXcJXXXXXXXXX_!!152408262.jpg的图片从提取商品信息的文字,
试了一下Tesseract(http://code.google.com/p/tesseract-ocr/), 安装了中文语言训练包,发现识别结果非常不理想。
不知道有没有其他支持中文的ocr开源库,识别效果还不错的?我看还有gocr等开源库,貌似不支持中文,有没有办法让它支持中文?
或者还有没有办法提高Tesseract的识别准确率的方法,比如是不是可以针对目标图片自己训练一下?
谢谢!
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #9598同步于 2012/10/13
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖
【求助】请教一个关于ORC的问题,有经验的同学帮忙看看
freehello
2012/10/13镜像同步3 回复
订阅后,新回复会通过你的通知中心匿名送达。
3 条回复
Tesseract好像对背景要求很高,背景最好是单色的,你那张图片背景太复杂了,我觉得前面预处理的时候对于中文字符的检测和分割比较重要吧。就是如何找到图片中可能是中文字符的部分,然后再对这部分做中文字符识别。
貌似确实没有完整识别出中文字符区域。有没有其他的运行在linux上的ocr库能够识别中文的?
【 在 handspeaker 的大作中提到: 】
: Tesseract好像对背景要求很高,背景最好是单色的,你那张图片背景太复杂了,我觉得前面预处理的时候对于中文字符的检测和分割比较重要吧。就是如何找到图片中可能是中文字符的部分,然后再对这部分做中文字符识别。
这个已经是开源软件里面最牛的了……别的我真不知道了,估计某些大企业自己会鼓捣这个东西,然后自己用吧。
【 在 credibler 的大作中提到: 】
: 貌似确实没有完整识别出中文字符区域。有没有其他的运行在linux上的ocr库能够识别中文的?