2024年6月4日发(作者:)
OCR相关
一、OCR识别技术介绍
OCR技术是光学字符识别的缩写(Optical Character Recognition),是通过
扫描等光学输入方式将各种票据、报刊、书籍、文稿及其它印刷品的文字转化为
图像信息,再利用文字识别技术将图像信息转化为可以使用的计算机输入技术。
可应用于银行票据、大量文字资料、档案卷宗、文案的录入和处理领域。适合于
银行、税务等行业大量票据表格的自动扫描识别及长期存储。相对一般文本,通
常以最终识别率、识别速度、版面理解正确率及版面还原满意度4个方面作为OCR
技术的评测依据;而相对于表格及票据, 通常以识别率或整张通过率及识别速度
为测定OCR技术的实用标准。
OCR识别技术不仅具有可以自动判断、拆分、 识别和还原各种通用型印刷体
表格,在表格理解上做出了令人满意的实用结果,能够自动分析文稿的版面布局,
自动分栏、并判断出标题、横栏、图像、表格等相应属性,并判定识别顺序,能
将识别结果还原成与扫描文稿的版面布局一致的新文本。表格自动录入技术,可
自动识别特定表格的印刷或打印汉字、字母、数字,可识别手写体汉字、手写体
字母、数字及多种手写符号,并按表格格式输出。提高了表格录入效率,可节省
大量人力。同时支持将表格识别直接还原成PTF、PDF、HTML等格式文档;并可以
对图像嵌入横排文本和竖排文本、表格文本进行自动排版面分析。
采用OCR识别技术,可以将其应用于银行票据光盘缩微系统,可以自动提取票
据要素,可减轻操作员的工作量,减少重复劳动,尤其是在与银行事后且监督系
统相结合后,可以替代原先的操作人员完成事后监督工作。由计算机自动识别票
据上的日期、帐号、金额等要素,通过银行事后监督系统与业务系统中的数据进
行比较,完成传统的事后监督操作;配有印章验证系统后,自动将凭证图像中的
印章与系统中预留的印鉴进行比较,完成印章的真伪识别。
利用目前的高新技术-OCR,直接从凭证影像中提取金额、帐号等重要数据,
代替人的手工录入,与条码识别/流水识别紧密结合,实现建立事后副本帐、完成
事后监督的工作。OCR处理一般使用性能较好的PC机,OCR处理程序一经启动会
自动扫描数据库中的凭证影像,发现有需OCR处理而未处理的,提取到本地进行
处理。
OCR手写体、印刷体识别技术,能识别不同人写的千差万别的手写体汉字和数
字,应用于本系统,识别凭证影像中储户填写的信息,如大写金额、小写金额、
帐号、存期、日期、证件号等,可以代替手工录入。同时被识别得出的金额还要
与流水识别所得的金额进行核对,核对成功,则OCR识别成功。这样处理是为了
避免误判。
经过对银行产生的实际凭证进行的大量测试,在实际开发过程中,根据银行
的实际需求,OCR技术在票据和表格识别能力和手写体自动识别能力上不断提升,
目前处理速度可达到每分钟60~80张票据,存折识别率已经达到了85%以上,存
单、凭条识别率达到90%以上,而85%以上的识别率就能减少80%以上的数据录
入员。
二、夏普SHARP DESK OCR使用方法
针对目前SHARP DESK V3.3版本已经整合了中文OCR功能,下面以此为例介
绍:
步骤一:安装SHARP DESK V3.3
步骤二:选则需要进行OCR转换的文档(只能转换TIFF或者PDF格式)
步骤三:按下方OCR按钮(图1)
OCR按钮
步骤四:弹出OCR设置项(图2)按照下图方式设置
1、选择文件格式(文档选DOC,表格选XLS)
2、根据原稿类型选择文档布局(尤其表格需要
特别选择)
3、选择文档语言(文档中有E文的要勾选英语)
步骤五:按确定后进行OCR识别
原稿文档 OCR转换后文档
三、提高OCR识别率技巧
由于存在光电扫描的转换,不可避免存在误差,但可以通过有效的设置技
巧来提高识别率:
1、一般使用200-300dpi进行扫描,过高的分辨率可能会导致将纸张上的细节
(污点、纹路等)信息扫描进去影响识别。
2、如果使用原稿盖扫描,需要将盖密实,否则没稿盖住的扫描区域会影响扫
描结果;
3、OCR必须使用黑白二值扫描,切记,灰度和彩色都会影响OCR识别率。
4、根据原稿的浓度对比度调整扫描软件设置的“亮度”和“对比度”,提高亮度
可以掩盖原稿的一些污渍,提高对比度可增加文字效果。
5、尽量将原稿放端正,扫描后文字倾斜了,就需要调整倾斜度,另外请务必
保证原稿的整洁干净!
7、识别区域越小,识别率越高;例如“①⑨”这样的序号,300dpi时选定区域
太大就会识别出错,如果识别区域选定适合,识别率就是100%。如果识别后
发现不理想,可以重新修改识别区域,甚至删除全部区域重新选定。
8、不同字体,必须分开识别区域,不能混在同一个识别区域里;
9、表格OCR选择相应的设置项——如表格文档布局和XLS的格式后,就能
很好地识别出并能保留完整的原稿排版。
10、对于300dpi下固定的识别出错字符,识别过程中不需要理会,全部扫描
识别完成后,在word里面,使用替换功能(Ctrl+H)一次性把全部字符换成
正确的。


发布评论