node.js - 为什么通过 pdftk 将多页 PDF 重复拆分为单独的页面会更改这些页面的 md5 校验和？-6ren

node.js - 为什么通过 pdftk 将多页 PDF 重复拆分为单独的页面会更改这些页面的 md5 校验和？

转载作者：搜寻专家更新时间：2023-10-31 23:39:22

25

4

我正在使用 pdftk并进行了一些测试，发现将多页 PDF 文件拆分为单独的单页 PDF 文件，然后为每个单页 PDF 生成一个 md5 哈希校验和(数字指纹)，每次我进行拆分时都会产生不同的哈希值。这就是结果，即使它是完全相同的文件且没有任何更改。

我的测试流程是:

解压 test.pdf(包含 10 页的简单纯文本 PDF)
使用 pdftk，将 test.pdf 分成 10 个单独的 PDF 文件(每个文件一页)
为 10 个单页 PDF 文件中的每一个生成 md5 哈希校验和
记录 10 个哈希校验和
重复步骤 1-4
请注意，所有哈希值都不同

旁注:解压后在 PDF 上生成校验和会在重复时产生完全相同的校验和。

我正在使用 node.js及其 crypto本练习的模块。

我的问题是:为什么校验和在重复时会有所不同？我会认为生成的 10 个单页文件与上次创建时完全相同。他们的父文档(以及各个页面本身)根本没有改变。

最佳答案

根据 PDF 规范，每当 PDF 创建者写出修改后的 PDF 时，它应该更新元数据条目的 /Info 数组中名为 /ModDate 的键。

此外，它(可能)会将 PDF 的 XMP 元数据结构中的文档 UUID 更改为新 ID。

因此，当您想使用 MD5(或任何类似方法)检查 PDF 生成过程中的“稳定结果”(考虑单元测试或其他)时，您应该在应用 MD5 之前执行以下两件事之一-总结:

“规范化”您的 PDF 输出以始终将相同的 ModDate 和 UUID 写入文件(如果您的 PDF 生成工具允许您以这种方式进行调整)，
或对规范化 /ModDate(可能还有 /CreationDate)的文件运行编辑(您可以使用 sed)和文件的 UUID 条目。

更新:由于您似乎已经熟悉 pdftk，您应该能够转储元数据文本文件(如 Ezra 所示):

pdftk in.pdf dump_data output data.txt

或(如果您需要):

pdftk in.pdf dump_data_utf8 output data.utf8.txt

然后编辑 data*.txt 文件，使它们满足您的需求:更改 PDF UUID(pdftk 调用它们 PdfID0/PdfID1 ) 到易于识别的值(00000... 和 fffff...)，将日期更改为另一个易于识别的日期。然后使用这些元数据值更新您的文件:

pdftk in.pdf update_info data.txt output in-updated.pdf \
      &&  mv in-updated.pdf in.pdf

或

pdftk in.pdf update_info data.utf8.txt output in-updated.utf8.pdf \
      &&  mv in-updated.utf8.pdf in.pdf

只有然后运行您的 Md5 校验和并查看它是否有效(或需要更多微调)。

关于node.js - 为什么通过 pdftk 将多页 PDF 重复拆分为单独的页面会更改这些页面的 md5 校验和？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/11417869/

25

4

0

文章推荐： node.js - socket.io - 为套接字获取多个字段？

文章推荐： unit-testing - 使用 express 在 node.js 中测试 HTTP 请求

文章推荐： php - 如何在 yii2 中创建自定义确认框

java - Arraylist 分为 -
我有一个数组列表: ArrayList allText = new ArrayList(); 其内容是这样的: [Alabama - Montgomery, Alaska - Juneau, Ariz
php - 开始和结束时间，分为 1 小时段
我有一个 timestamp 格式的开始和结束时间。我想将它们分成多个时间段，例如 1 小时。 $t1 = strtotime('2010-05-06 12:00:00'); $t2 = strtot
css - span10 分为 3 列
我需要将 span10 分成 3 列，但我无法将它们排列起来。我应该在 span10 中添加一个 span12 还是使用 offset 还是？？
Pandas - 分为 24 小时区 block ，但不是午夜到午夜
我有一个时间序列。我想从早上 8 点到第二天早上 7:59 分成 24 小时的区 block 。我知道如何按日期分组，但我尝试过使用 TimeGroupers 和 DateOffsets 处理这个 8
java - Android Java 分为 4 个整数
我收到“街道号码邮政编码城市”形式的地址(作为字符串)。我想要做的是将街道和号码与邮政编码和城市分开。通常你可以按空格分割。但有些街道名称中也有空格，例如:“Emile Van Ermengemlaa
java - 将 JList 分为 2 组的优化方法
我有一个用户列表。其中一些用户处于第一状态，而其他用户处于第二状态。所以我想要的是将这个列表显示为首先，它按排序顺序显示存在 = 1 的用户，然后按排序顺序显示存在 = 2 的用户。这里的排序是根据用
javascript - 将 div 分为 3 列
我感觉我搜索了整个网络，但找不到一种方法将不同高度的 div 很好地划分为 3 列，就像 http://www.ing.nl 上那样 headertekst headerteksttesth
css - td 内的 Bootstrap 按钮下拉菜单，分为 2 行
Bootstrap 3 按钮下拉菜单出现问题。你可以在这里看到我的两个例子: http://www.bootply.com/W1dLusilMk http://www.bootply.com/GGBv
javascript - 返回的 php JSON 分为 2 个 Javascript 对象
我在 php 中执行以下操作 foreach($QuestionAsekd as $k => $v){ $grp_name = $v['NAME']; $groupValues[$gr
python - Pandas DataFrame [cell=(label,value)]，分为 2 个独立的数据框
我找到了一种用pandas解析html的绝妙方法。我的数据格式有点奇怪(见下文)。我想将这些数据拆分为 2 个单独的数据帧。注意每个单元格如何由，分隔...是否有任何真正有效的方法来分割所有这些单元
html - CSS
分为 2 列。没有

首页

博学

6Ren·AI

商城

node.js - 为什么通过 pdftk 将多页 PDF 重复拆分为单独的页面会更改这些页面的 md5 校验和？