- r - 以节省内存的方式增长 data.frame
- ruby-on-rails - ruby/ruby on rails 内存泄漏检测
- android - 无法解析导入android.support.v7.app
- UNIX 域套接字与共享内存(映射文件)
我需要扫描上传的PDF,以确定其中的页面是否全部为纵向页面或是否有横向页面。是否可以使用PHP或linux命令扫描这些页面的PDF?
最佳答案
(更新的答案-向下滚动...)
您可以使用pdfinfo
(poppler-utils或xpdf-tools的一部分)或identify
(ImageMagick工具包的一部分)。
确认:
identify -format "%f Page %s: Width: %W -- Height: %H\n" T-VD7.PDF
输出示例:
T-VD7.PDF Page 0: Width: 595 -- Height: 842
T-VD7.PDF Page 1: Width: 595 -- Height: 842
T-VD7.PDF Page 2: Width: 1191 -- Height: 842
[...]
T-VD7.PDF Page 11: Width: 595 -- Height: 421
T-VD7.PDF Page 12: Width: 595 -- Height: 842
或更简单:
identify -format "%s: %Wx%H\n" T-VD7.PDF
给出:
0: 595x842
1: 595x842
2: 1191x842
[...]
11: 595x421
12: 595x842
注意,
identify
如何使用基于零的页面计数机制!
identify
使您可以非常轻松,非常广泛地调整输出格式。
pdfinfo input.pdf | grep "Page.*size:"
输出示例:
Page size: 595.276 x 841.89 pts (A4)
如果涉及多页PDF,则
pdfinfo
绝对比
identify
更快,更精确。 (我测试的13页PDF用
identify
处理了31秒,而
pdfinfo
需要不到半秒的时间...。)
pdfinfo
只会报告
第一页的大小,仅报告。要获取所有页面的大小(您可能知道,有些PDF使用混合的页面大小和混合的方向),您必须修改以下命令:
pdfinfo -f 3 -l 13 input.pdf | grep "Page.*size:"
现在输出:
Page 1 size: 595.276 x 841.89 pts (A4)
Page 2 size: 595.276 x 841.89 pts (A4)
Page 3 size: 1191 x 842 pts (A3)
[....]
Page 12 size: 595 x 421 pts (A5)
Page 13 size: 595.276 x 841.89 pts (A4)
这将打印第3页的大小(要报告的
f irst)到第13页(要报告的
l ast)。
pdfinfo \
-f 1 \
-l 1000 \
Vergleich-VD7.PDF \
| grep "Page.* size:" \
| \
| while read Page _pageno size _width x _height rest; do
[ "$(echo "${_width} / 1"|bc)" -gt "$(echo "${_height} / 1"|bc)" ] \
&& echo "Page $_pageno is landscape..." \
|| echo "Page $_pageno is portrait..." ; \
done
(
bc
-trick是必需的,因为
-gt
比较仅适用于带整数的shell。用
1
除以
bc
会将可能的实际值四舍五入为整数...)
Page 1 is portrait...
Page 2 is portrait...
Page 3 is landscape...
[...]
Page 12 is landscape...
Page 13 is portrait...
pdfinfo
发现页面旋转...
pdfinfo
了。小夜曲X在评论中说,他/她的问题是发现旋转的页面。
pdfinfo
用户真正吸收...
pdfinfo
实用程序:
xpdf-utils
软件包的一部分(在某些平台上也称为xpdf-tools
)。 poppler-utils
软件包的一部分(在某些平台上也称为poppler-tools
,有时它不是作为软件包分离出来的,而是主要poppler
软件包的一部分)。 pdfinfo
输出
pdfinfo
命令的示例输出。经过测试的文件是一个2页的PDF,其中第一页为纵向A4,第二页为横向A4格式:
kp@mbp:~$ pdfinfo -f 1 -l 2 a4portrait+landscape.pdf Producer: GPL Ghostscript 9.05CreationDate: Thu Jul 26 14:23:31 2012ModDate: Thu Jul 26 14:23:31 2012Tagged: noForm: nonePages: 2Encrypted: noPage 1 size: 595 x 842 pts (A4)Page 1 rot: 0Page 2 size: 842 x 595 pts (A4)Page 2 rot: 0File size: 3100 bytesOptimized: noPDF version: 1.4
Do you see the lines saying Page 1 rot: 0
and Page 1 rot: 0
?
Do you notice the lines saying Page 1 size: 595 x 842 pts (A4)
and Page 2 size: 842 x 595 pts (A4)
and the differences between the two?
pdfinfo
outputNow let's compare this to the output of XPDF's pdfinfo
:
kp@mbp:~$ xpdf-pdfinfo -f 1 -l 2 a4portrait+landscape.pdf Producer: GPL Ghostscript 9.05CreationDate: Thu Jul 26 14:23:31 2012ModDate: Thu Jul 26 14:23:31 2012Tagged: noPages: 2Encrypted: noPage 1 size: 595 x 842 pts (A4)Page 2 size: 842 x 595 pts (A4)File size: 3100 bytesOptimized: noPDF version: 1.4
You may notice one more difference, if you look closely enough. I won't point my finger to it, and will keep my mouth shut for now... :-)
pdfinfo
correctly reports rotation of page 2Next, I rotate the second page of the file by 90 degrees using pdftk
(I don't have Adobe Acrobat around):
pdftk \
a4portrait+landscape.pdf \
cat 1 2E \
output a4portrait+landscape---page2-landscaped-by-pdftk.pdf
现在,Poppler的
pdfinfo
报告如下:
Page 2 rot: 90
行告诉我们我们正在寻找什么。 XPDF的
pdfinfo
本质上将报告与已更改文件相同的信息,与原始文件相同。当然,它仍然可以正确捕获更改后的
Creator:
,
Producer:
和
*Date:
信息,但是它将丢失旋转的页面...
Page 2 size: 842 x 595 pts (A4)
信息部分看到。但是,它在当前PDF中显示为纵向页面,如Page 2 rot: 90
部分所示。
0
(不旋转),90
(向东旋转,或顺时针旋转90度),180
(向南旋转,翻滚的页面图像,上下颠倒或顺时针旋转180度),270
(向西旋转,或者逆时针旋转90度,或者顺时针旋转270度)。 pdfinfo
现在还报告每个页面的旋转状态(从2012年3月1日发布的Poppler v0.19.0开始)。 pdffonts
现在还报告每种字体的字体编码(从2012年3月15日发布的Poppler v0.19.1开始)。 pdftocairo
-用于创建PNG,JPEG,PostScript,EPS,PDF,SVG(使用开罗)的实用程序pdfseparate
-提取PDF页面的实用工具pdfunite
-合并PDF文件的实用程序pdfdetach
-从PDF pdftohtml
-从PDF文件转换HTML的实用程序关于php - 如何使用PHP或Linux脚本找到PDF的方向?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/11529715/
这个问题在这里已经有了答案: Different ways of loading a file as an InputStream (6 个答案) 关闭 8 年前。 在我的 gradle java
给定一个 User 类: class User end 我想使用 .class_eval 定义一个新常量.所以: User.class_eval { AVOCADO = 'fruit' } 如果我尝试
这可能听起来很奇怪,但我正在开发一个需要查找 div 内的元素或 div 本身的插件。 脚本根据用户选择查找元素,但内容(包括标记)是可变的。因此脚本将按如下方式查找元素: $('.block').f
关闭。此题需要details or clarity 。目前不接受答案。 想要改进这个问题吗?通过 editing this post 添加详细信息并澄清问题. 已关闭 7 年前。 Improve th
我需要在按我自己的函数排序的对的多集中查找并删除一个值。显然, .find 总是将迭代器返回到末尾,而不是返回到搜索到的值。有小费吗?这是函数: struct cmp { bool operato
求助!我将如何通过遍历查看字符并计算有效字符出现之前的下划线数量来查找和删除前导下划线。以及从字符串末尾向后迭代以查找任何尾随下划线。 我可以使用下面的方法来删除下划线,但是如何迭代才能找到下划线。
如果你在 $(xml) 中有下面的 xml,你会变得懒惰: $(xml).find("animal").find("dog").find("beagle").text() 在 jQuery 中是否有类
你如何找到4个文件的交集? 我用了grep -Fx -f 1.txt 2.txt 3.txt 4.txt ,但它似乎只适用于 2 个文件。同样comm -12 1.txt 2.txt无法扩展为 4 个
我已经完成了标记的姿势估计并获得了 rvec 和 tvec 值。我不知道如何找到它的中心,因为我需要绘制一个需要中心值的圆柱体。 我该怎么做? 最佳答案 标记的 tvec 是标记从原点的平移 (x,y
我有一个任务,我需要找到 2 个单链接(单对单)列表的交集。我还必须为 2 个双向链接(双重 vs 双重)列表执行此操作: 对于单链表,我使用 mergeSort() 对两个列表进行排序,然后逐项比较
我是 R 的新手,我有一个 100x100 的方阵。我想找到这个矩阵的最大特征值。我试过了 is.indefinite(x) 但是它写 is.indefinite(x) : argument x is
您好,我是 svg 和 JavaScript 的新手,当鼠标位于 svg 上方时,我试图使一些 svg 元素弹出(通过缩放),反之亦然,当鼠标离开 svg 元素时。 我已经能够通过使用转换使 svg
我正在尝试为 scala 项目编写一个类,但在多个地方使用 class、def、while 等关键字出现此错误。 它发生在这样的地方: var continue = true while (conti
我有两个 pandas 数据框,它们只取自一列并将日期列设置为索引,所以现在我有两个 Series。我需要找到这些系列的相关性。 这里有几行来自dfd: index change 2018-
我正在尝试调整我的 Vagrantfile,因此如果它丢失,它会自动在项目根目录中创建一个文件夹。创建文件夹没问题,但我无法找到创建该文件夹的位置。 我发现此信息可在 Vagrant::Environ
我正在尝试在 jquery 中找到 Test3 的位置,请有人引导我走上正确的道路。 我需要jquery来显示5 Test7 Test2 Test6 Test5 Test3 Test8 谢谢 最佳
大家早上好 我有一个像这样的图像列表: 使用 jQuery 如何查找 ul#preload 中包含特定字符串(例如“green”)的所有图像 src 类似... var new_src = j
我正在开发一个修改 Excel 文件的应用程序。 如何找到任意行中最后使用的单元格? 示例:行号 => 5 中最后使用的单元格 最佳答案 要找到一行中的最后一个单元格,您需要 Range 的 End
我刚刚陷入 react native ,需要一些帮助才能在找到 token 时导航到 protected 屏幕。我应该在哪里寻找应用程序加载时的 token ?如何在不多次调用导航的情况下导航用户一次
非常奇怪...此页面是 protected 内容还是我不知道的内容?我尝试单击下一页 anchor 。 参见this page first. 我试图用这个来抓取元素 var buttonNext =
我是一名优秀的程序员,十分优秀!