前言
大家早好、午好、晚好吖 ❤ ~欢迎光临本文章

话不多说,直接开搞,如果有什么疑惑/资料需要的可以点击文章末尾名片领取源码
一.docx模块
Python可以利用python-docx模块处理word文档,处理方式是面向对象的。
也就是说python-docx模块会把word文档,文档中的段落、文本、字体等都看做对象,
对对象进行处理就是对word文档的内容处理。
二.相关概念
如果需要读取word文档中的文字(一般来说,程序也只需要认识word文档中的文字信息),
需要先了解python-docx模块的几个概念。
-
Document对象,表示一个word文档。
-
Paragraph对象,表示word文档中的一个段落
-
Paragraph对象的text属性,表示段落中的文本内容。
三.模块的安装和导入
需要注意,python-docx模块安装需要在cmd命令行中输入pip install python-docx,
(最后那句英文Successfully installed,成功地安装完成)
注意在导入模块时,用的是import docx。
四.读取word文本
在了解了上面的信息之后,就很简单了,下面先创建一个D:\temp\word.docx文件,并在其中输入如下内容。
import docx
file=docx.Document(r"F:\python从入门到放弃\7\2\wenjian.docx")
print('段落:'+str(len(file.paragraphs)))
#
# for para in file.paragraphs:
# print(para.text)
for i in range(len(file.paragraphs)):
print("第"+str(i)+"段的内容是:"+file.paragraphs[i].text)
import sys
from docx import Document
from docx.shared import Inches
def main

本文介绍了如何使用python-docx模块处理word文档,包括Document对象、Paragraph对象和text属性的概念,以及如何安装、导入模块。通过示例展示了读取word文本和解析docx中插入的文件和图片的方法,强调docx文件本质上是一个ZIP文件,包含XML内容。
最低0.47元/天 解锁文章
1万+

被折叠的 条评论
为什么被折叠?



