python-3.4 - 移植到Python3 : PyPDF2 mergePage() gives TypeError-6ren

python-3.4 - 移植到Python3 : PyPDF2 mergePage() gives TypeError

转载作者：行者123 更新时间：2023-12-02 18:36:23

26

4

我在 Windows 7 上使用 Python 3.4.2 和 PyPDF2 1.24(还使用 reportlab 3.1.44，以防有帮助)。

我最近从 Python 2.7 升级到 3.4，并且正在移植我的代码。此代码用于创建一个空白 pdf 页面，其中嵌入了链接(使用 reportlab)并将其与现有 pdf 页面合并(使用 PyPDF2)。我在使用 Reportlab 时遇到了一个问题，因为保存 Canvas 时使用了 StringIO，需要将其更改为 BytesIO，但在执行此操作后，我遇到了此错误:

Traceback (most recent call last):
File "C:\cms_software\pdf_replica\builder.py", line 401, in merge_pdf_files
    input_page.mergePage(link_page)
File "C:\Python34\lib\site-packages\PyPDF2\pdf.py", line 2013, in mergePage
    self.mergePage(page2)
File "C:\Python34\lib\site-packages\PyPDF2\pdf.py", line 2059, in mergePage
    page2Content = PageObject._pushPopGS(page2Content, self.pdf)
File "C:\Python34\lib\site-packages\PyPDF2\pdf.py", line 1973, in _pushPopGS
    stream = ContentStream(contents, pdf)
File "C:\Python34\lib\site-packages\PyPDF2\pdf.py", line 2446, in __init
    stream = BytesIO(b_(stream.getData()))
File "C:\Python34\lib\site-packages\PyPDF2\generic.py", line 826, in getData
    decoded._data = filters.decodeStreamData(self)
File "C:\Python34\lib\site-packages\PyPDF2\filters.py", line 326, in decodeStreamData
    data = ASCII85Decode.decode(data)
File "C:\Python34\lib\site-packages\PyPDF2\filters.py", line 264, in decode
    data = [y for y in data if not (y in ' \n\r\t')]
File "C:\Python34\lib\site-packages\PyPDF2\filters.py", line 264, in 
    data = [y for y in data if not (y in ' \n\r\t')]
TypeError: 'in <string>' requires string as left operand, not int

这是回溯提到的行和上面的行:

link_page = self.make_pdf_link_page(pdf, size, margin, scale_factor, debug_article_links)
if link_page != None:
input_page.mergePage(link_page)

以下是 make_pdf_link_page 函数的相关部分:

packet = io.BytesIO()
can = canvas.Canvas(packet, pagesize=(size['width'], size['height']))
....# left out code here is just reportlab specifics for size and url stuff
can.linkURL(url, r1, thickness=1, color=colors.green)
can.rect(x1, y1, width, height, stroke=1, fill=0)
# create a new PDF with Reportlab that has the url link embedded
can.save()
packet.seek(0)
try:
    new_pdf = PdfFileReader(packet)
except Exception as e:
    logger.exception('e')
    return None
return new_pdf.getPage(0)

我假设这是使用 BytesIO 的问题，但我无法使用带有 StringIO 的 reportlab 创建页面。这是一个关键功能，过去可以与 Python 2.7 完美配合，因此我非常感谢对此的任何反馈。谢谢!

更新:我还尝试从使用 BytesIO 更改为仅写入临时文件，然后合并。不幸的是我遇到了同样的错误。这是临时文件版本:

import tempfile
temp_dir = tempfile.gettempdir()
temp_path = os.path.join(temp_dir, "tmp.pdf")
can = canvas.Canvas(temp_path, pagesize=(size['width'], size['height']))
....
can.showPage()
can.save()
try:
    new_pdf = PdfFileReader(temp_path)
except Exception as e:
    logger.exception('e')
    return None
return new_pdf.getPage(0)

更新:我发现了一些有趣的信息。看来如果我注释掉 can.rect 和 can.linkURL 调用它就会合并。因此，在页面上绘制任何内容，然后尝试将其与我现有的 pdf 合并会导致错误。

最佳答案

深入研究 PyPDF2 库代码后，我找到了自己的答案。对于 python 3 用户来说，旧的库可能会很棘手。即使他们说他们支持 python 3，他们也不一定测试所有内容。在本例中，问题出在 PyPDF2 中的filters.py 中的 ASCII85Decode 类。对于 python 3，此类需要返回字节。我从 pdfminer3k 借用了相同类型函数的代码，pdfminer3k 是 pdfminer 的 python 3 的端口。如果您将 ASCII85Decode() 类替换为此代码，它将起作用:

import struct
class ASCII85Decode(object):
    def decode(data, decodeParms=None):
        if isinstance(data, str):
            data = data.encode('ascii')
        n = b = 0
        out = bytearray()
        for c in data:
            if ord('!') <= c and c <= ord('u'):
                n += 1
                b = b*85+(c-33)
                if n == 5:
                    out += struct.pack(b'>L',b)
                    n = b = 0
            elif c == ord('z'):
                assert n == 0
                out += b'\0\0\0\0'
            elif c == ord('~'):
                if n:
                    for _ in range(5-n):
                        b = b*85+84
                    out += struct.pack(b'>L',b)[:n-1]
                break
        return bytes(out)

关于python-3.4 - 移植到Python3 : PyPDF2 mergePage() gives TypeError，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/27974409/

26

4

0

文章推荐： jmeter - J-Meter - Moodle 测试脚本

文章推荐： reactjs - 连续成功触发两个 useReducer 钩子(Hook)

文章推荐： asp.net - ASP.NET 中的 OpenStreetMap

文章推荐： android - GoogleMap.OnMarkerDragListener 无法正常工作

python - 我无法安装 pyPDF 包根本找不到 pyPdf 的发行版
我尝试安装这个包... $ pip search pyPdf PyPDFLite - Simple PDF Writer. pypdfocr
python - PyPDF 合并和写入问题
使用它时出现意外错误。第一部分来自我在网上找到的脚本，我试图用它来提取 PDF 大纲中标识的特定部分。一切正常，除了在 output.write(outputfile1)它说: PdfReadErro
python - pyPdf 如何理解文档边界？
Here我找到了用于拆分 pdf 页面的代码。 #!/usr/bin/env python import copy, sys from pyPdf import PdfFileWriter, PdfF
python - pypdf python工具
使用 pypdf python 模块如何读取以下 pdf 文件 http://www.envis-icpe.com/pointcounterpointbook/Hindi_Book.pdf # -*-
python - pyPdf 无法写入文件？
我是Python新手。我尝试打开pdf文件并将其内容写入新的文本文件。文本文件名称由 pdf 名称生成。到目前为止我已经尝试过，但它没有达到我的预期。我怎样才能实现它 import glob,
python - pyPdf 错误参数无效
我实际上是在使用 pyPdf 打开、读取和写入 PDF 文件的内容。为此，我使用了这些代码行: from pyPdf import PdfFileWriter, PdfFileReader pdf
python - 用于间接对象提取的 pyPdf
按照这个例子，我可以将所有元素列成一个pdf文件 import pyPdf pdf = pyPdf.PdfFileReader(open("pdffile.pdf")) list(pdf.pages)
python - pypdf 将多个pdf文件合并为一个pdf
如果我有 1000 多个 pdf 文件需要合并为一个 pdf， from PyPDF2 import PdfReader, PdfWriter writer = PdfWriter() for i i
pdf - PyPdf:将每页一分为二，用空格填充
我有一个 PDF 文件(A4，纵向布局)，我想将其中的每一页分成一半高度。输出文件也应该是A4和纵向布局，但每页的下半部分需要是空白的。我看到了https://stackoverflow.com/a
pdf - PyPdf:将每页一分为二，用空格填充
我有一个 PDF 文件(A4，纵向布局)，我想将其中的每一页分成一半高度。输出文件也应该是A4和纵向布局，但每页的下半部分需要是空白的。我看到了https://stackoverflow.com/a
python - 为什么我不能使用切片表示法通过 pyPDF 迭代页面
我正在运行以下代码来创建一个新的 PDF 文件，其中包含源 PDF 的除第一页之外的所有页面: import os from pyPdf import PdfFileReader, PdfFileWr
python - pyPdf IndirectObject in/Rotate
这个问题在这里已经有了答案: How can I rotate a page with PyPDF2? (2 个答案) 关闭 12 个月前。我们有一个简单的脚本来读取传入的 PDF 文件。如果是横
python 和 pyPdf - 如何从页面中提取文本以便行与行之间有空格
目前，如果我使用 pyPdf 和 extractText() 创建一个 pdf 页面的页面对象，会发生什么行被连接在一起。例如，如果页面的第 1 行说“hello”而第 2 行说“world”，则从
python - 使用 pyPDF 从文档中检索自定义页面标签
目前我正在研究将 PDF 与 pyPdf 合并，但有时输入的顺序不正确，所以我正在研究抓取每一页的页码以确定它应该进入的顺序(例如，如果有人将一本书分成 20 份 10 页的 PDF，而我想将它们重新
python - Python 中 Pypdf 包中的断言错误
我在 Windows 平台上使用 Python 2.4 和 PyPdf 1.13。我正在尝试使用以下代码将列表中的 PDF 文件合并为一个文件: import os from pyPdf import
python - 使用 pyPdf 合并非标准 PDF
我想将几个 PDF 文件合并为一个 PDF 文档。事实证明，输入文件并不完全符合标准。 EOF 标记后跟一些附加信息: >> startxref 1994481 %%EOF %%PPIRoute: 4
python - pyPdf PdfFileReader 与 PdfFileWriter
我有以下代码: import os from pyPdf import PdfFileReader, PdfFileWriter path = "C:/Real Python/Course mater
python - pyPdf 忽略 PDF 文件中的换行符
我正在尝试将 PDF 的每一页提取为字符串: import pyPdf pages = [] pdf = pyPdf.PdfFileReader(file('g-reg-101.pdf', 'rb')
python - pyPdf 无法从我的 PDF 中的某些页面中提取文本
我正在尝试使用 pyPdf 从多页 PDF 中提取和打印页面。问题是，文本不是从某些页面中提取的。我在这里放了一个示例文件: http://www.4shared.com/document/kmJF6
使用 pyPDF 删除空白页的 Python 脚本
我正在尝试使用 pyPDF 编写几个 python 脚本，将 PDF 页面拆分为六个单独的页面，正确排序它们(通常正面和背面打印，因此每个其他页面都需要以不同方式排序)，并删除结果输出文档末尾的空白页

首页

博学

6Ren·AI

商城

python-3.4 - 移植到Python3 : PyPDF2 mergePage() gives TypeError