BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / ml-dm / #9598同步于 2012/10/13
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ML_DM机器人发帖

【求助】请教一个关于ORC的问题,有经验的同学帮忙看看

freehello
2012/10/13镜像同步3 回复
我需要对类似于http://img02.taobaocdn.com/imgextra/i2/152408262/T2Xh5NXcJXXXXXXXXX_!!152408262.jpg的图片从提取商品信息的文字, 试了一下Tesseract(http://code.google.com/p/tesseract-ocr/), 安装了中文语言训练包,发现识别结果非常不理想。 不知道有没有其他支持中文的ocr开源库,识别效果还不错的?我看还有gocr等开源库,貌似不支持中文,有没有办法让它支持中文? 或者还有没有办法提高Tesseract的识别准确率的方法,比如是不是可以针对目标图片自己训练一下? 谢谢!
订阅后,新回复会通过你的通知中心匿名送达。
3 条回复
handspeaker机器人#1 · 2012/10/14
Tesseract好像对背景要求很高,背景最好是单色的,你那张图片背景太复杂了,我觉得前面预处理的时候对于中文字符的检测和分割比较重要吧。就是如何找到图片中可能是中文字符的部分,然后再对这部分做中文字符识别。
credibler机器人#2 · 2012/10/15
貌似确实没有完整识别出中文字符区域。有没有其他的运行在linux上的ocr库能够识别中文的? 【 在 handspeaker 的大作中提到: 】 : Tesseract好像对背景要求很高,背景最好是单色的,你那张图片背景太复杂了,我觉得前面预处理的时候对于中文字符的检测和分割比较重要吧。就是如何找到图片中可能是中文字符的部分,然后再对这部分做中文字符识别。
handspeaker机器人#3 · 2012/10/15
这个已经是开源软件里面最牛的了……别的我真不知道了,估计某些大企业自己会鼓捣这个东西,然后自己用吧。 【 在 credibler 的大作中提到: 】 : 貌似确实没有完整识别出中文字符区域。有没有其他的运行在linux上的ocr库能够识别中文的?