docx模块
from docx import Document from docx.enum.text import WD_ALIGN_PARAGRAPH #设置对象居中、对齐等。 from docx.enum.text import WD_TAB_ALIGNMENT,WD_TAB_LEADER #设置制表符等 from docx.shared import Inches #设置图像大小 from docx.shared import Pt #设置像素、缩进等 from docx.shared import RGBColor #设置字体颜色 from docx.shared import Length #设置宽度
模板里的表格和行列遍历
from docx import Document #导入模块 document = Document("template.docx") #打开模板 for t,table in enumerate(document.tables): #遍历所有表格,这个模板里有3个表格 for r,row in enumerate(table.rows): #遍历表格的行 for c,cell in enumerate(row.cells): #遍历每一行的列 cell.text = "%s表%s行%s列%s\n"%(cell.text,t,r,c) #在单元格里写入当前的位置(表格、行、列)
处理word文档
新建文档类
首先新建一个空白文档类 Document ,如下:
from docx import Document document = Document()
获取文件中的表格集
file = docx.Document(filedocx) #打开文件 tables = file.tables # 获取文件中的表格集 table=tables[0] ###获取第一个表格
编辑已存在的word文档
其实吧,这玩意儿只能编辑已存在的word文档,之所以有个“创建空白文档”的功能,只不过是拷贝一份空白word文档到工作区间,再在空白文档上编辑,看起来似乎是“创建空白文档”罢了。本质上还是编辑已存在的word文档,捂脸中...
打开一个word文档,编辑完后,一定要记得保存。如果保存文件名和原文件名不一样,则会另存为一份word文档;若文件名一样,则会不加提示的保存修改内容。如下:
from docx import Document document = Document('existing-document-file.docx') document.save('new-file-name.docx')
新增段落
在word中 段落
是最常见的,创建段落 paragraph 的操作如下:
paragraph = document.add_paragraph('这是个段落。')
在此段落之前插入一个段落,如下:
prior_paragraph = paragraph.insert_paragraph_before('这是前面的段落。')
新增标题
新增标题代码如下:
document.add_heading('这是个标题')
修改标题大小,有1-9种规格,如下:
document.add_heading('The role of dolphins', level=2)
如果使用 level=0
,则会新增一个带有下划线样式的标题。
新增分页符
代码如下:
document.add_page_break()
新增表格
创建一个2行2列的表格 Table,如下:
table = document.add_table(rows=2, cols=2)
获取第一行第二列的单元格类,如下:
cell = table.cell(0, 1)
写入数据,如下:
cell.text = '这是第一行第二列的单元格'
不仅如此,还能以数组的形式获取整个行或列,如下:
row = table.rows[1] row.cells[0].text = '第二行第一列' row.cells[1].text = '第二行第二列'
或循环操作,如下:
for row in table.rows: for cell in row.cells: print(cell.text)
用 len()
方法获取行数或列数,如下:
row_count = len(table.rows)
col_count = len(table.columns)
增加行,如下:
row = table.add_row()
设置表格样式,如下:
table.style = 'LightShading-Accent1'
插入图片
插入本地图片,如下:
document.add_picture('demo.png')
默认情况下,图片大小往往不尽如人意,调整图片大小,如下:
from docx.shared import Inches document.add_picture('demo.png', width=Inches(1.0), height=Inches(1.0))
若同时定义宽度和高度,则图片会被拉伸或压缩到指定大小;若仅定义宽度或高度,则图会自适应调整大小。所以,建议仅定义宽度即可。
段落操作
设置段落样式
设置段落样式,如下:
document.add_paragraph('这是一个样式为 ListBullet 的段落', style='ListBullet')
或
paragraph = document.add_paragraph('这是一个样式为 ListBullet 的段落') paragraph.style = 'List Bullet'
设置段落对齐方式
段落对齐方式有 左对齐
、 文字居中
、 右对齐
、 文本两端对齐
等,更多对齐方式请移步 WD_ALIGN_PARAGRAPH
from docx.enum.text import WD_ALIGN_PARAGRAPH # LEFT => 左对齐 # CENTER => 文字居中 # RIGHT => 右对齐 # JUSTIFY => 文本两端对齐 paragraph = document.add_paragraph("你说啥") paragraph_format = paragraph.paragraph_format paragraph_format.alignment = WD_ALIGN_PARAGRAPH.CENTER
设置段落缩进
设置段落缩进,可为负值,如下:
from docx.shared import Inches paragraph = document.add_paragraph("你说啥") paragraph_format = paragraph.paragraph_format paragraph_format.left_indent = Inches(0.5)
也可以设置首行缩进,如下:
paragraph_format.first_line_indent = Inches(-0.25)
设置段落制表符
详情请移步 TabStops
设置段落间距
分为 段前
和 段后
,设置值用 Pt
单位是 磅
,如下:
paragraph_format.space_before = Pt(18)
paragraph_format.space_after = Pt(12)
设置段落行距
当行距为 最小值
和 固定值
时,设置值单位为 磅
,需要用 Pt
;当行距为 多倍行距
时,设置值为数值,如下:
from docx.shared import Length #SINGLE => 单倍行距(默认) #ONE_POINT_FIVE => 1.5倍行距 #DOUBLE2 => 倍行距 #AT_LEAST => 最小值 #EXACTLY => 固定值 #MULTIPLE => 多倍行距 paragraph.line_spacing_rule = WD_LINE_SPACING.EXACTLY #固定值 paragraph_format.line_spacing = Pt(18) # 固定值18磅 paragraph.line_spacing_rule = WD_LINE_SPACING.MULTIPLE #多倍行距 paragraph_format.line_spacing = 1.75 # 1.75倍行间距
设置段落分页
- 孤行控制
防止在页面顶端单独打印段落末行或在页面底端单独打印段落首行。 - 与下段同页
防止在选中段落与后面一段间插入分页符。 - 段中不分页
防止在段落中出现分页符。 - 段前分页
在选中段落前插入分页符。
#widow_control => 孤行控制 #keep_with_next => 与下段同页 #page_break_before => 段前分页 #keep_together => 段中不分页 paragraph_format.keep_with_next = True
字体操作
设置粗体和斜体
在设置粗体和斜体之前,我们先简单了解一下 段落
里的运行机制。段落包含很多块级的格式,比如缩进、行高、制表符等。每一个小片段叫做一个 run ,可以对 run
设置粗体和斜体等属性。
我们可以设置如下:
paragraph = document.add_paragraph() paragraph.add_run('这是一个带有') paragraph.add_run('粗体').bold = True paragraph.add_run('和') paragraph.add_run('斜体').italic = True paragraph.add_run('的段落。')
设置字体属性
对 run
设置字体、大小、颜色下划线等,更多属性请移步 Font ,如下:
from docx.shared import RGBColor,Pt #all_caps => 全部大写字母 #bold => 加粗 #color => 字体颜色 #complex_script => 是否为“复杂代码” #cs_bold => “复杂代码”加粗 #cs_italic => “复杂代码”斜体 #double_strike => 双删除线 #emboss => 文本以凸出页面的方式出现 #hidden => 隐藏 #imprint => 印记 #italic => 斜体 #name => 字体 #no_proof => 不验证语法错误 #outline => 显示字符的轮廓 #shadow => 阴影 #small_caps => 小型大写字母 #snap_to_grid => 定义文档网格时对齐网络 #strike => 删除线 #subscript => 下标 #superscript => 上标 #underline => 下划线 paragraph = document.add_paragraph() paragraph.add_run('这是一个带有') paragraph.add_run('颜色').font.color.rgb = RGBColor(54, 95, 145) paragraph.add_run('的') paragraph.add_run('大字').font.size = Pt(36) # 字体大小设置,和word里面的字号相对应
设置字符样式
除了设置段落样式外,还可以设置一组字符样式,比如字体、大小、颜色、粗体、斜体等,如下:
# 自定义样式 Emphasis paragraph = document.add_paragraph('这是一个带有') paragraph.add_run('自定义样式', 'Emphasis') paragraph.add_run('的段落')
或
paragraph = document.add_paragraph('这是一个带有 ') run = paragraph.add_run('自定义样式') run.style = 'Emphasis' paragraph.add_run('的段落')
页眉和页脚
更多内容请移步 Working with Headers and Footers