word插入注释-教你用Python读取PDF信息插入Word文档，工作效率翻倍！-网赚资源_AI工具_网课资源_虚拟资源_知识付费

需求描述：朋友在平时工作中会经常重复性地打开不同PDF文件，选取其中特定的几组信息复制粘贴到不同的Word文档中，完成一份PDF文件平均耗时15分钟，想试试Python代码能否帮忙。

由于其涉及文件隐私，将需求简化如下：我这提供一份PDF版《笨办法学Python》，想把其中第五页的第1段和第4段填充到Word文档 “笔记.docx” 特定位置：

上图为PDF中的目标文字；下图为Word文档要填充的位置：

思路

首先利用PDFMiner模块解析PDF文件，转化成PDF内容的文本列表；根据目标位置在列表中提取目标文本；利用Python处理Word文档的库docx-mailmerge模块，进行文本填充。

PDFMiner模块

PDFMiner是一个专注于从PDF文档中提取、分析文本信息的工具。它不仅可以获取特定页码特定位置处的信息，也能获得字体等信息。其工作原理如图所示：

看不懂原理图没关系，我们关心的是应用问题。首先安装PDFMiner，注意Python3要安装pdfminer3k，可以通过pip install pdfminer3k进行安装

解析PDF涉及代码步骤较多，先不展开，文末提供注释源码供参考。通过PDFMiner解析，文本内容按区域存到不同页码的文本list中；每一页又作为元素存入整个文档的list中。即假设content代表整个PDF文本信息，content[0]为第一页信息，content[4]即我们想要的第五页信息。而第五页中，按照list元素顺序，我们想要的第一段和第四段就可以通过content[4][1]和content[4][4]拿到了：

docx-mailmerge模块

这个模块的应用类似于你先在Word文档中特定位置去定义好变量，之后在代码中通过MailMerge函数为变量赋值。

首先是安装：pip install docx-mailmerge

接下来去Word文档中定义要插入的变量，在要插入文本的位置选择 “插入”→“文档部件”→“域”：

在弹出的窗口中选择mailmerge变量，中文直译“邮件合并”，域名是自己定义的变量名，这里我用firstTED 来代表第一段：

设置完成后会看到出现在Word文档中。同理，我们设置fourthTED来代表第四段，最终结果如图：

至此，Word文档中变量定义完成，继续回到代码中。我们已经拿到了第一段和第四段的文本，接下来就是将其和新定义的firstTED 和 fourthTED 融合：

template = "../读书笔记.docx"document = MailMerge(template)document.merge(    firstTED = content[4][1],    fourthTED = content[4][4],)document.write("读书笔记更新.docx")

最终在PDF文件旁会生成新的“读书笔记更新.docx”：

其内容如图：

目标达成！写给朋友的初版代码，对于能拿到的文本信息准确度也是很高的，而且可以批量处理文档。代码运行几秒钟，便将人力几个小时的工作完成了，余下的是相对轻松的校验和修正。可能你一天的繁琐工作，对代码而言就是几秒的事情。

回顾

就实现效果来看，达到了预期，但仍有待提高。最终效果与PDF文件的格式是否规范有直接关系，有许多扫描件PDF文档每页都像是图片，就无法通过PDFMiner顺利获取到文本信息。后续我们将尝试先把PDF转图片，再通过OCR识别图片中文字信息的思路来搞定。

此外，为了展示，选用的PDF和Word文档以及要插入的信息都较规范简洁，在实际需求中，因为批量操作，也会遇到各种大小问题，这些都要在实战中去不断完善。

扫描下方海报二维码

限时特惠：本站每日持续更新海量各大内部网赚创业教程，会员可以下载全站资源点击查看详情
站长微信：11082411

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

word插入注释-教你用Python读取PDF信息插入Word文档，工作效率翻倍！

作者信息

文章展示

抖音短视频实战：从零基础到带货高手，掌握月销百万的秘诀与实战技巧

新蓝海赛道，童装走秀爆款Ai视频，10分钟一条竞争小变现机会超多，小…

AI+跨境电商训练营：AI赋能品牌设计，从选品到市场定位实战

同城店铺实战：五步精准定位，从店铺选址到推广策略，打造火爆店铺

TikTok运营变现全攻略：从手机设置到爆款打造，再到Shopify建站与收益提取

24年今日头条最新暴利掘金玩法，动手不动脑，简单易上手。轻松矩阵实现…

排行榜展示

加入小柚宝库网VIP，全站付费课程免费学习！限时五折优惠

[网赚项目] 信息差赚钱副业，每单能收入几百上千元不等！

TikTok安装注册保姆级实操课，tiktok账号注册0失败，提高你的账号运营段位

流量截留玩法，一单99+

谷歌无脑文章搬运一天搞100美金+微头条搬砖单号一天100+情感项目月赚30W

《2022副业印钞社》自媒体赚钱课：一起搞钱、搞流量

word插入注释-教你用Python读取PDF信息插入Word文档，工作效率翻倍！

相关文章

作者信息

文章展示

排行榜展示

标签