用python将图片转为word文档

原创已于 2022-11-27 01:45:58 修改 · 4.2k 阅读

CC 4.0 BY-SA版权

文章标签：

于 2022-11-27 01:42:10 首次发布

1 篇文章

订阅专栏

博主分享了如何使用Python和tesseract-ocr将模糊图片转换为可编辑的Word文档的过程，涉及工具安装、代码实现和处理常见问题的方法，耗时1小时完成基本功能。

昨天突发需求要打印一张图片上的文档，图片拍太昏暗，完全不具有可读性，于是想试试转为word文档，编辑以后再打印，百度了一下，找到了一个大神的文档”使用python在实现图片（包括扫描件的图片类pdf）转换成word文档过程中的常见问题_py617的博客-优快云博客_python 图片转word“，根据这个文档，基本搞定了需求，但不知道是图片太模糊还是没使用什么高级设置，总之对导出的文档还是得作一些编辑工作才能使用。

根据原文档操作的话，基本框架就有了，但还需要处理一些报错，于是将我的一些处理记录下来，写一篇文章存档：

一、安装必要的工具和库：

1、Python 建议安装3.7或以上版本（我自己安装的是3.8版本，pycharm和anaconda3）

2、tesseract-ocr 这个一定要装，基本算是整个项目的核心工具了，下载地址： https://github.com/UB-Mannheim/tesseract/wiki ，安装最新版本

3、库支持：（如果下载较慢，可以在命令后用-i加入临时国内源，如 -i https://pypi.tuna.tsinghua.edu.cn/simple）

pip install pillow

pip install opencv-python

pip install fitz

pip install PyMuPDF

pip install pytesseract

pip install python-docx

二、可运行的简单代码：