Python提取PDF指定内容并生成新文件-6ren

Python提取PDF指定内容并生成新文件

转载作者：qq735679552 更新时间：2022-09-27 22:32:09

28

4

CFSDN坚持开源创造价值，我们致力于搭建一个资源共享平台，让每一个IT人在这里找到属于你的精彩世界.

这篇CFSDN的博客文章Python提取PDF指定内容并生成新文件由作者收集整理，如果你对这篇文章有兴趣，记得点赞哟.

在之前的Python办公自动化案专题中，我们已经介绍了如何有选择的提取某些页面进行合并.

但是很多时候，我们并不会预知希望提取的页号，而是希望将包含指定内容的页面提取合并为新PDF，本文就以两个真实需求为例进行讲解.

01需求描述

数据是一份有286页的上市公司公开年报PDF，大致如下。

Python提取PDF指定内容并生成新文件

现在需要利用 Python 完成以下两个需求。

“
需求一：提取所有包含战略二字的页面并合并新PDF 。

需求二：提取所有包含图片的页面，并分别保存为 PDF 文件。
”

02前置知识和逻辑梳理

2.1 PyPDF2 模块实现合并。

PyPDF2 导入模块的代码常常是:

from PyPDF2 import PdfFileReader, PdfFileWriter

这里导入了两个方法:

PdfFileReader 可以理解为读取器
PdfFileWriter 可以理解为写入器

利用 PyPDF2 实现合并运用的一下逻辑:

读取器将所有pdf读取一遍
读取器将读取的内容交给写入器
写入器统一输出到一个新pdf

隐含知识点：读取器只能将读取的内容一页一页交给写入器。

2.2 获取与添加页面。

之前我们的推文中提到这两个代码，下面列出作为复习:

.getPage 获取特定页
.addPage 添加特定页

2.3 图片和文字的处理。

要实现本文的需求还要做到很重要的一个判断：确定页面中有无包含的文字或图片。

判断是否包含特定的文字比较简单，遍历每一页的时候都将包含的文本抽提出，做字符串层面的判断即可，代码思路:

利用 pdfplumber 打开PDF 文件
获取指定的页，或者遍历每一页
利用 .extract_text() 方法提取当前页的文字
判断 “战略” 是否在提取的文字中

判断是否包含图片，思路和上面是类似的，但方法不同。图片考虑用正则的方法识别，用 fitz 和 re 配合，具体见下文代码。

03代码实现

3.1 需求一的实现。

首先来完成需求一的任务，导入需要用到的库：读取写入PDF文件的 PyPDF2 以及抽提文本的 pdfplumber 。

from PyPDF2 import PdfFileReader, PdfFileWriterimport pdfplumber

指定文件所在的路径，同时初始化写入器，将文件交给读取器:

path = r"C:xxxxxx"pdf_writer = PdfFileWriter()pdf_reader = PdfFileReader(path + r"公司年报.PDF")

以上下文管理器形式通过 pdfplumber 打开文件，同时用 .getNumPages 获取读取器的最大页利于遍历每一页来抽提文字:

with pdfplumber.open(path + r"公司年报.PDF") as pdf:    for i in range(pdf_reader.getNumPages()):        page = pdf.pages[i]        print(page.extract_text())

我们抽提文字的目的是用来判断，将符合要求的页码作为读取器 .getPage 的参数，最后用 .addPage 交给写入器:

with pdfplumber.open(path + r"公司年报.PDF") as pdf:    for i in range(pdf_reader.getNumPages()):        page = pdf.pages[i]        print(page.extract_text())        if "战略" in page.extract_text():            pdf_writer.addPage(pdf_reader.getPage(i))            print(i + 1, page.extract_text())

完成识别后让写入器输出为需要的文件名:

with open(path + r"ew_公司年报.pdf", "wb") as out:    pdf_writer.write(out)

至此，我们就完成了包含特定文字内容页面的提取，并整合成一个PDF。所有的页面均包含“战略”二字:

Python提取PDF指定内容并生成新文件

需求一完整代码如下，感兴趣的读者可以自行研究。

from PyPDF2 import PdfFileReader, PdfFileWriterimport pdfplumber path = r"C:xxx"pdf_writer = PdfFileWriter()pdf_reader = PdfFileReader(path + r"公司年报.PDF") with pdfplumber.open(path + r"公司年报.PDF") as pdf:    for i in range(pdf_reader.getNumPages()):        page = pdf.pages[i]        print(page.extract_text())        if "战略" in page.extract_text():            pdf_writer.addPage(pdf_reader.getPage(i))            print(i + 1, page.extract_text()) with open(path + r"ew_公司年报1.pdf", "wb") as out:    pdf_writer.write(out)

3.2 需求二的实现。

接下来完成需求二的任务。首先导入需要的库:

from PyPDF2 import PdfFileReader, PdfFileWriterimport fitzimport reimport os

指定文件所在的路径:

path = r"C:xxxxxx"

正则识别图片的部分不细讲，之前的推文已经介绍过，我们直接看代码:

page_lst = []checkImg = r"/Subtype(?= */Image)"pdf = fitz.open(path + r"公司年报.PDF")lenXREF = pdf._getXrefLength() for i in range(lenXREF):    text = pdf._getXrefString(i)    isImage = re.search(checkImg, text)    if isImage:        page_lst.append(i) print(page_lst)

获取到所有包含图片的页面后，再结合读取器和写入器的配合就能完成新 PDF 的产生。注意本需求是所有图片单独输出，因此获取到页面后交给写入器直接输出成文件:

pdf_reader = PdfFileReader(path + r"公司年报.PDF")for page in page_lst:    pdf_writer = PdfFileWriter()    pdf_writer.addPage(pdf_reader.getPage(page))    with open(path + r"公司年报_{}.pdf".format(page + 1), "wb") as out:        pdf_writer.write(out)

至此也完成了第二个需求。需要说明的是目前没有非常完美提取PDF图片的方法，本案例介绍的方法识别图片也并不稳定。读者可以利用自己的数据多做尝试。完整代码如下:

from PyPDF2 import PdfFileReader, PdfFileWriterimport fitzimport reimport os path = r"C:xxx" page_lst = []checkImg = r"/Subtype(?= */Image)"pdf = fitz.open(path + r"公司年报.PDF")lenXREF = pdf._getXrefLength()for i in range(lenXREF):    text = pdf._getXrefString(i)    isImage = re.search(checkImg, text)    if isImage:        page_lst.append(i) print(page_lst) pdf_reader = PdfFileReader(path + r"公司年报.PDF")for page in page_lst:    pdf_writer = PdfFileWriter()    pdf_writer.addPage(pdf_reader.getPage(page))    with open(path + r"公司年报_{}.pdf".format(page + 1), "wb") as out:        pdf_writer.write(out)

实现这两个单个需求后，就可以将相关代码封装并结合os等模块实现批量操作，解放双手.

到此这篇关于Python提取PDF指定内容并生成新文件的文章就介绍到这了,更多相关Python提取PDF指定内容内容请搜索我以前的文章或继续浏览下面的相关文章希望大家以后多多支持我！。

原文链接：https://blog.csdn.net/aaahtml/article/details/117650641 。

最后此篇关于Python提取PDF指定内容并生成新文件的文章就讲到这里了,如果你想了解更多关于Python提取PDF指定内容并生成新文件的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

28

4

0

文章推荐： Python提取特定时间段内数据的方法实例

文章推荐： Python激活Anaconda环境变量的详细步骤

tomcat - 无法使用 JDK6 生成 keystore ，但可以使用 JDK5 生成
我正在尝试使用以下 keytool 命令为我的应用程序生成 keystore : keytool -genkey -alias tomcat -keystore tomcat.keystore -ke
javascript - D3.js:生成 X 轴会删除我的一些点的标签，生成 Y 轴会将它们全部删除
编辑:在西里尔正确解决问题后，我注意到只需将生成轴的函数放在用于生成标签的函数下面就可以解决问题。我几乎读完了 O'Reilly 书中关于 D3.js 的教程，并在倒数第二页上制作了散点图，但是当添
graphql - 从 Schema 生成 GraphQL GUI 和从 GUI 生成 Schema
虽然使用 GraphiQL 效果很好，但我的老板要求我实现一个用户界面，用户可以在其中通过 UI 元素(例如复选框、映射关系)检查呈现给他们的元素并获取数据，这样做将为该人生成 graphql 输入，
java - 如何删除 Netbean 6.8 中的生成源(jax-ws)？我应该根据网站地址从 WSDL 生成 WS 客户端还是从 api 生成 WS 客户端？
我尝试在 Netbean 6.8 中使用 ws-import 生成 Java 类。我想重新生成 jax-ws，因为在 ebay.api.paypalapi 包中发现了一个错误(我认为该错误是由于 Pa
生成 Perl 日期时间？
我有一个 perl 脚本，它获取系统日期并将该日期写入文件名。系统日期被分配给 TRH1 变量，然后它被设置为一个文件名。 $TRH1 =`date + %Y%m%d%H%M`; print "TR
Haskell UUID 生成
我是 Haskell 的新手，需要帮助。我正在尝试构建一种必须具有某种唯一性的新数据类型，因此我决定使用 UUID 作为唯一标识符: data MyType = MyType { uuid ::
php - 生成 XML
我制作了一个脚本，它可以根据 Mysql 数据库中的一些表生成 XML。该脚本在 PHP 中运行。 public function getRawMaterials($apiKey, $format
openssl - 生成、签署和验证数字签名
所以这是我的项目中的一个问题。 In this task, we will use OpenSSL to generate digital signatures. Please prepare a f
r - 生成/绘制对数正态生存函数
我在 SAS LIFEREG 中有一个加速故障时间模型，我想绘制它。因为 SAS 在绘图方面非常糟糕，我想实际重新生成 R 中曲线的数据并将它们绘制在那里。 SAS 提出了一个尺度(在指数分布固定为
Django key 生成
我正在为 Django 后端制作一个样板，并且我需要能够使它到达下一个下载它的人显然无法访问我的 secret key 的地方，或者拥有不同的 key 。我一直在研究一些选项，并在这个过程中进行了实验
iPhone Excel 生成
我正在创建一个生成采购订单的应用程序。我可以根据用户输入的详细信息创建文本文件。我想生成一个看起来比普通文本文件好得多的 Excel。有没有可以在我的应用程序中使用的开源库？最佳答案目前还没有任何
ScalaCheck 生成 BST
我正在尝试使用 ScalaCheck 为 BST 创建一个 Gen，但是当我调用 .sample 方法时，它给了我 java.lang.NullPointerException。我哪里错了？ seal
Javascript 测验结果计算/生成
已关闭。此问题需要 debugging details 。目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and the
verilog 生成 if/else
我尝试编写一些代码，例如(在verilog中): parameter N = 128; if (encoder_in[0] == 1) begin 23 binary_out = 1;
hibernate - Grails 生成
我正忙于在 Grails 项目中进行从 MySQL 到 Postgres 的相当复杂的数据迁移。我正在使用 GORM 在 PostGres 中生成模式，然后执行 MySQL -> mysqldump
XSLT 生成 UUID
如何使用纯 XSLT 生成 UUID？基本上是寻找一种使用 XSLT 创建独特序列的方法。该序列可以是任意长度。我正在使用 XSLT 2.0。最佳答案这是一个good example 。基本上，
ios - 生成.app文件并安装在设备上
我尝试安装.app文件，但是当我安装并单击“同步”(在iTunes中)时，我开始在设备上开始安装，然后停止，这是一个问题，我不知道在哪里，但我看到了我无法解决的奇怪的事情: 最佳答案似乎您没有在Xc
java - 生成 JavaDocs？
自从我生成 JavaDocs 以来已经有一段时间了，我确信这些选项在过去 10 年左右的时间里已经得到了改进。我能否得到一些有关生成器的建议，该生成器将输出类似于 .Net 文档结构的 JavaDo
.net - 生成 PDF
我想学习如何生成 PDF，我不想使用任何第三方工具，我想自己用代码创建它。到目前为止，我所看到的唯一示例是我通过在第 3 方 dll 上打开反射器查看的代码，以查看发生了什么。不幸的是，到目前为止我看
C# Excel 生成
我正在从 Epplus 库生成 excel 条形图。这是我成功生成的。我的 table 是这样的 Mumbai Delhi Financial D

首页

博学

6Ren·AI

商城