上传者: 38733787
|
上传时间: 2021-11-05 10:20:28
|
文件大小: 64KB
|
文件类型: -
本文实例讲述了Python实现pdf文档转txt的方法。分享给大家供大家参考,具体如下:
首先,这是一个比较粗糙的版本,因为已经够用了,而且对pdf的格式不熟悉,所以暂时没有进一步优化。
还有,这是转成txt的,所以如果是有图片的pdf是无法保存图片的。
至于本来就是图片的文本,这里是无法分析出来的。那些图片的pdf,估计要用图形匹配的方式来处理,类似于超速拍摄的车牌识别。
不过这样的程度,已经不是文本处理了。扯远了。。。
转出来的文字,好像按照pdf里面的所展示的来换行了,看不到有什么规则还原,我也不知道怎么处理,将就着用吧。
另外,初始代码是网上找的,最初地址不知道哪里了。
用到了第三方库