平时处理文档的时候,经常会遇到需要把 PDF 转成 Word 的情况。找网上的在线工具,要么限制页数,要么就需要付费,有时候还担心文件隐私问题。

干脆自己用 Python 写个小脚本吧。主要利用了 pdf2docx 这个库,过程比想象中简单很多:

  1. 读取 PDF 文件。
  2. 遍历每一页,提取文字和图片。
  3. 重新组装成 docx 格式保存下来。

虽然转换复杂的排版(比如数学公式)还会有格式错乱的问题,但用来处理普通文档已经够用了。自己动手写工具解决问题的感觉非常有成就感,之后打算把这个小工具分享出来,方便大家使用。