上传者: 38666753
|
上传时间: 2022-02-01 14:54:02
|
文件大小: 134.53MB
|
文件类型: -
大麦网源码java
1.网店工商信息图片文字提取
图片内容如下所示,但每张图片中信息出现的位置不尽相同,题目要求所写的程序能够完成如下几个功能点。
程序能够识别不同格式的图片,并能够提取所要求的信息。
从图片之中提取企业注册号和企业名称信息,并保存到Excel表格之中。
程序能够自动读取企业工商信息图片所在的文件夹路径。
识别速度保持在60秒识别50张图片,识别正确率保证在95%以上。
2.Tess4j
了解题目要求之后,我们便开始来解决问题。首先明确一点的是,肯定不能从头去写文字识别算法或者文字识别程序,OCR(Optical
Character
Recognition
,
光学字符识别)发展这么多年来,开源的库肯定不少,只需找到适合中文识别的类库或者项目即可。
个人采用的是Tess4j开源库,其中Tess4j是由Tesseract扩展而来,Tesseract是HP实验室开发由Google维护的开源OCR引擎,Tess4j支持Tiff,jpeg,gif,png,pdf等多种格式识别。我们只需要在下载类库,然后编写下述代码便可实现文字识别,使用方法很简单。如果你要使用的话,请注意pac