python自动化系列之提取pdf文字和图片

liangblog

于 2022-07-06 13:17:24 发布

阅读量1.2k

点赞数 1

CC 4.0 BY-SA版权

分类专栏： python实用文章标签： python 自动化开发语言

本文链接：https://blog.youkuaiyun.com/weixin_42551921/article/details/125549061

python实用专栏收录该内容

154 篇文章 ¥59.90 ¥99.00

订阅专栏

本文介绍如何使用Python进行PDF自动化处理，重点讲解了pdfplumber库用于提取PDF文字，以及fitz库用于将PDF转换为图片和添加文本注释的操作。通过实例代码展示了这两个库的基本用法。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

在python中有许多开源的库可以处理Pdf文档，最常用的Pypdf2库可以读取文档，合并，分割pdf文档，但是也有局限性：

无法提取文档中的文字

提取PDF文字需要使用另外的库，如pdfplumbe
提取PDF中的图片需要使用fitz库

使用pdfplumbe提取文字

pdfplumbe使用可以用来解析PDF文件，获取其文本内容、标题、表格等的开源工具；
开源代码地址：https://github.com/jsvine/pdfplumber

安装pdfplumbe:

pip install pdfplumbe

引入：

import pdfplumbe

简单使用代码示例：

filepath = 'H:/test_w.pdf'

def extract_text_info(filepath):
    """
    提取PDF中的文字
    @param filepath:文件路径
    @return:
    """
    with pdfplumber.open(filepath) as pdf:
        # 获取第2页数据
        page = pdf.pages[3]
        print(page.extract_text()) #提取文字
        table = page.extract_tables(

了解本专栏