docx模块

一,docx模块
Python可以利用python-docx模块处理word文档,处理方式是面向对象的。也就是说python-docx模块会把word文档,文档中的段落、文本、字体等都看做对象,对对象进行处理就是对word文档的内容处理。
二,相关概念
如果需要读取word文档中的文字(一般来说,程序也只需要认识word文档中的文字信息),需要先了解python-docx模块的几个概念。
1,Document对象,表示一个word文档。
2,Paragraph对象,表示word文档中的一个段落
3,Paragraph对象的text属性,表示段落中的文本内容。
三,模块的安装和导入
需要注意,python-docx模块安装需要在cmd命令行中输入pip install python-docx,如下图表示安装成功(最后那句英文Successfully installed,成功地安装完成)
注意在导入模块时,用的是import docx。
 
from docx import Document
from docx.enum.text import WD_ALIGN_PARAGRAPH #设置对象居中、对齐等。
from docx.enum.text import WD_TAB_ALIGNMENT,WD_TAB_LEADER #设置制表符等
from docx.shared import Inches #设置图像大小
from docx.shared import Pt #设置像素、缩进等
from docx.shared import RGBColor #设置字体颜色
from docx.shared import Length #设置宽度

 

 

模板里的表格和行列遍历

from docx import Document  #导入模块


document = Document("template.docx")  #打开模板


for t,table in  enumerate(document.tables):  #遍历所有表格,这个模板里有3个表格
        for r,row in enumerate(table.rows):  #遍历表格的行
                for c,cell in enumerate(row.cells): #遍历每一行的列
                        cell.text = "%s表%s行%s列%s\n"%(cell.text,t,r,c)  #在单元格里写入当前的位置(表格、行、列)

 

 

处理word文档

 

新建文档类

首先新建一个空白文档类 Document ,如下:

from docx import Document

document = Document()

 

 获取文件中的表格集

    file = docx.Document(filedocx)  #打开文件

    tables = file.tables  # 获取文件中的表格集
    table=tables[0] ###获取第一个表格

 

 

编辑已存在的word文档

python-docx 不仅可以创建word文档,还可以编辑已存在的word文档。
其实吧,这玩意儿只能编辑已存在的word文档,之所以有个“创建空白文档”的功能,只不过是拷贝一份空白word文档到工作区间,再在空白文档上编辑,看起来似乎是“创建空白文档”罢了。本质上还是编辑已存在的word文档,捂脸中...
打开一个word文档,编辑完后,一定要记得保存。如果保存文件名和原文件名不一样,则会另存为一份word文档;若文件名一样,则会不加提示的保存修改内容。如下:

from docx import Document

document = Document('existing-document-file.docx')
document.save('new-file-name.docx')

新增段落

在word中 段落 是最常见的,创建段落 paragraph 的操作如下:

paragraph = document.add_paragraph('这是个段落。')

 

在此段落之前插入一个段落,如下:

prior_paragraph = paragraph.insert_paragraph_before('这是前面的段落。')

 

 

新增标题

新增标题代码如下:

document.add_heading('这是个标题')

 

修改标题大小,有1-9种规格,如下:

document.add_heading('The role of dolphins', level=2)

 

如果使用 level=0 ,则会新增一个带有下划线样式的标题。

 

新增分页符

代码如下:

document.add_page_break()

 

新增表格

创建一个2行2列的表格 Table,如下:

table = document.add_table(rows=2, cols=2)

 

 

获取第一行第二列的单元格类,如下:

cell = table.cell(0, 1)

 

 

写入数据,如下:

cell.text = '这是第一行第二列的单元格'

 

不仅如此,还能以数组的形式获取整个行或列,如下:

row = table.rows[1]
row.cells[0].text = '第二行第一列'
row.cells[1].text = '第二行第二列'

或循环操作,如下:

for row in table.rows:
    for cell in row.cells:
        print(cell.text)

 

 用 len() 方法获取行数或列数,如下:

row_count = len(table.rows)
col_count = len(table.columns)

 

增加行,如下:

row = table.add_row()

设置表格样式,如下:

table.style = 'LightShading-Accent1'

插入图片

插入本地图片,如下:

document.add_picture('demo.png')

默认情况下,图片大小往往不尽如人意,调整图片大小,如下:

from docx.shared import Inches

document.add_picture('demo.png', width=Inches(1.0), height=Inches(1.0))

若同时定义宽度和高度,则图片会被拉伸或压缩到指定大小;若仅定义宽度或高度,则图会自适应调整大小。所以,建议仅定义宽度即可。

段落操作

设置段落样式

设置段落样式,如下:

document.add_paragraph('这是一个样式为 ListBullet 的段落', style='ListBullet')

 

 或

paragraph = document.add_paragraph('这是一个样式为 ListBullet 的段落')
paragraph.style = 'List Bullet'
设置段落对齐方式

段落对齐方式有 左对齐 、 文字居中 、 右对齐 、 文本两端对齐等,更多对齐方式请移步 WD_ALIGN_PARAGRAPH

from docx.enum.text import WD_ALIGN_PARAGRAPH

# LEFT      =>  左对齐
# CENTER    =>  文字居中
# RIGHT     =>  右对齐
# JUSTIFY   =>  文本两端对齐

paragraph = document.add_paragraph("你说啥")
paragraph_format = paragraph.paragraph_format
paragraph_format.alignment = WD_ALIGN_PARAGRAPH.CENTER
设置段落缩进

设置段落缩进,可为负值,如下:

from docx.shared import Inches

paragraph = document.add_paragraph("你说啥")
paragraph_format = paragraph.paragraph_format
paragraph_format.left_indent = Inches(0.5)

也可以设置首行缩进,如下:

paragraph_format.first_line_indent = Inches(-0.25)

 

设置段落制表符

详情请移步 TabStops

设置段落间距

分为 段前 和 段后 ,设置值用 Pt 单位是  ,如下:

paragraph_format.space_before = Pt(18)
paragraph_format.space_after = Pt(12)

 

设置段落行距

当行距为 最小值 和 固定值 时,设置值单位为  ,需要用 Pt ;当行距为 多倍行距 时,设置值为数值,如下:

from docx.shared import Length

#SINGLE         =>  单倍行距(默认)
#ONE_POINT_FIVE =>  1.5倍行距
#DOUBLE2        =>  倍行距
#AT_LEAST       =>  最小值
#EXACTLY        =>  固定值
#MULTIPLE       =>  多倍行距

paragraph.line_spacing_rule = WD_LINE_SPACING.EXACTLY #固定值
paragraph_format.line_spacing = Pt(18) # 固定值18磅
paragraph.line_spacing_rule = WD_LINE_SPACING.MULTIPLE #多倍行距
paragraph_format.line_spacing = 1.75 # 1.75倍行间距

 

 

 

设置段落分页
    • 孤行控制
      防止在页面顶端单独打印段落末行或在页面底端单独打印段落首行。
    • 与下段同页
      防止在选中段落与后面一段间插入分页符。
    • 段中不分页
      防止在段落中出现分页符。
    • 段前分页
      在选中段落前插入分页符。
#widow_control      =>  孤行控制
#keep_with_next     =>  与下段同页
#page_break_before  =>  段前分页
#keep_together      =>  段中不分页

paragraph_format.keep_with_next = True

 

字体操作

设置粗体和斜体

在设置粗体和斜体之前,我们先简单了解一下 段落 里的运行机制。段落包含很多块级的格式,比如缩进、行高、制表符等。每一个小片段叫做一个 run ,可以对 run 设置粗体和斜体等属性。
我们可以设置如下:

paragraph = document.add_paragraph()
paragraph.add_run('这是一个带有')
paragraph.add_run('粗体').bold = True
paragraph.add_run('')
paragraph.add_run('斜体').italic = True
paragraph.add_run('的段落。')
设置字体属性

对 run 设置字体、大小、颜色下划线等,更多属性请移步 Font ,如下:

from docx.shared import RGBColor,Pt

#all_caps       =>  全部大写字母
#bold           =>  加粗
#color          =>  字体颜色
#complex_script =>  是否为“复杂代码”
#cs_bold        =>  “复杂代码”加粗
#cs_italic      =>  “复杂代码”斜体
#double_strike  =>  双删除线
#emboss         =>  文本以凸出页面的方式出现
#hidden         =>  隐藏
#imprint        =>  印记
#italic         =>  斜体
#name           =>  字体
#no_proof       =>  不验证语法错误
#outline        =>  显示字符的轮廓
#shadow         =>  阴影
#small_caps     =>  小型大写字母
#snap_to_grid   =>  定义文档网格时对齐网络
#strike         =>  删除线
#subscript      =>  下标
#superscript    =>  上标
#underline      =>  下划线

paragraph = document.add_paragraph()
paragraph.add_run('这是一个带有')
paragraph.add_run('颜色').font.color.rgb = RGBColor(54, 95, 145)
paragraph.add_run('')
paragraph.add_run('大字').font.size = Pt(36)  # 字体大小设置,和word里面的字号相对应

设置字符样式

除了设置段落样式外,还可以设置一组字符样式,比如字体、大小、颜色、粗体、斜体等,如下:

# 自定义样式 Emphasis

paragraph = document.add_paragraph('这是一个带有')
paragraph.add_run('自定义样式', 'Emphasis')
paragraph.add_run('的段落')

paragraph = document.add_paragraph('这是一个带有 ')
run = paragraph.add_run('自定义样式')
run.style = 'Emphasis'
paragraph.add_run('的段落')

页眉和页脚

更多内容请移步 Working with Headers and Footers

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

posted @ 2020-10-12 12:08  小白也会飞  阅读(1127)  评论(0编辑  收藏  举报