java - PdfBox - 使用获取字体信息-6ren

java - PdfBox - 使用获取字体信息

转载作者：行者123 更新时间：2023-11-29 05:31:43

27

4

我正在尝试使用 Square Annotation 从 pdf 中获取文本。我使用以下代码使用 PDFBOX.
从 PDF 中提取文本代码

try {    
            PDDocument document = null;
            try {
                document = PDDocument.load(new File("//Users//" + usr + "//Desktop//BoldTest2 2.pdf"));
                List allPages = document.getDocumentCatalog().getAllPages();
                for (int i = 0; i < allPages.size(); i++) {
                    PDPage page = (PDPage) allPages.get(i);
                    Map<String, PDFont> pageFonts = page.getResources().getFonts();
                    List<PDAnnotation> la = page.getAnnotations();
                    for (int f = 0; f < la.size(); f++) {
                        PDAnnotation pdfAnnot = la.get(f);
                        PDFTextStripperByArea stripper = new PDFTextStripperByArea();
                        stripper.setSortByPosition(true);
                        PDRectangle rect = pdfAnnot.getRectangle();

                        float x = 0;
                        float y = 0;
                        float width = 0;
                        float height = 0;
                        int rotation = page.findRotation();

                        if (rotation == 0) {
                            x = rect.getLowerLeftX();
                            y = rect.getUpperRightY() - 2;
                            width = rect.getWidth();
                            height = rect.getHeight();
                            PDRectangle pageSize = page.findMediaBox();
                            y = pageSize.getHeight() - y;
                        }
                        Rectangle2D.Float awtRect = new Rectangle2D.Float(x, y, width, height);
                        stripper.addRegion(Integer.toString(f), awtRect);
                        stripper.extractRegions(page);
                        PrintTextLocation2 prt = new PrintTextLocation2();
                        if (pdfAnnot.getSubtype().equals("Square")) {
                            testTxt = testTxt + "\n " + stripper.getTextForRegion(Integer.toString(f));
                        }
                    }
                }
            } catch (Exception ex) {
            } finally {
                if (document != null) {
                    document.close();
                }
            }
        } catch (Exception ex) {
        }

通过使用此代码，我只能获取 PDF 文本。如何在文本中获取字体信息，如 BOLD ITALIC。非常感谢建议或引用。

最佳答案

由 PDFTextStripperByArea 扩展的 PDFTextStripper 规范化(即删除格式)文本(参见 JavaDoc comment ):

* This class will take a pdf document and strip out all of the text and ignore the
* formatting and such.

如果你查看源代码，你会看到字体信息在这个类中是可用的，但是在打印之前它被归一化了:

protected void writePage() throws IOException
{
    [...]
        List<TextPosition> line = new ArrayList<TextPosition>();
        [...]
            if(!overlap(positionY, positionHeight, maxYForLine, maxHeightForLine))
            {
                writeLine(normalize(line,isRtlDominant,hasRtl),isRtlDominant);
                line.clear();
                [...]
            }
............

ArrayList 中的TextPosition 实例具有所有格式信息。解决方案可以专注于根据要求重新定义现有方法。我在下面列出了一些选项:

private List normalize(List line, boolean isRtlDominant, boolean hasRtl)

如果你想要你自己的normalize方法，你可以复制整个PDFTextStripper在您的项目中上课并更改副本的代码。让我们将这个新类称为 MyPDFTextStripper，然后根据要求定义新方法。同样复制PDFTextStripperByArea作为 MyPDFTextStripperByArea 将扩展 MyPDFTextStripper。

protected void writePage()

如果您只需要一个新的writePage 方法，您可以简单地扩展PDFTextStripper。，并覆盖此方法，然后如上所述创建 MyPDFTextStripperByArea。

writeLine(normalize(line,isRtlDominant,hasRtl),isRtlDominant)

其他解决方案可能通过将 pre-normalization 信息存储在某个变量中然后使用它来覆盖 writeLine 方法。

希望这对您有所帮助。

关于java - PdfBox - 使用获取字体信息，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/20855376/

27

4

0

文章推荐： ios - iOS 上的 MapboxGL native : Get MGLPointFeature on tap

文章推荐： java - 如果包含其他数据则显示列表 AlertDialog

文章推荐： java - 使用 opencsv - java.lang.OutOfMemoryError : Java heap space

pdfbox - PDFBox 2.0转图片，但是找不到 "org.apache.pdfbox.tools.imageio"
在 apache PDFBox 网站上，http://pdfbox.apache.org/2.0/migration.html ,PDF 渲染示例。 ImageIOUtil.writeImage(bi
pdfbox - Apache PDFBox 删除字符之间的空格
我们正在使用 PDFBox 从 PDF 中提取文本。某些 PDF 的文本无法正确提取。下图显示了 PDF 中的一部分作为图像: 文本提取后，我们得到以下文本: 3, 8 5 EU R 1 Nett
pdfbox - Apache PDFBOX 中的文本替换为图像
任何人都可以帮我了解如何使用 Apache PDFBOX 将文本替换为图像吗？最佳答案 import java.io.File; import java.io.IOException;
pdfbox - LucenePDFDocument 从 pdfbox 消失了吗？
我正在升级我的项目中的库并将 pdfbox 从 0.6.7 升级到 1.6.0 版，但找不到 LucenePDFDocument 类。 Apache 页面上的文档/教程中仍然提到了该类。有任何想法吗？
pdfbox - 如何在 Apache PDfBox 中设置页面缩放选项
在我的应用程序中，我使用 Apache PDFBox 来呈现 PDF 文件并进行静音打印。 PDFBox 可以很好地渲染 PFD，但我遇到了问题缩放来到图片。在这里我想在打印 PDF 之前设置页
pdfbox - 使用 pdfbox 解析文件内容时使用后备字体 - 会导致错误吗？
我正在使用使用 pdfbox 2.0.3 的 Apache Tika 1.14。我用它来提取文件的文本内容。在生产模式下处理许多文件时，我会记录许多如下语句: WARN o.a.p.pdmodel
pdfbox - 使用 PDFBox 将 PDF 文件转换为图像
有人能给我一个关于如何使用 Apache PDFBox 将 PDF 文件转换为不同图像的示例吗(PDF 的每一页一个图像)？最佳答案 1.8.* 版本的解决方案: PDDocument docume
pdfbox - 使用 PDFBOX 根据 PDF 中的输出识别文本
我正在使用 PDF BOX 获取 PDF 文本的颜色信息。我可以使用以下代码获得输出。但是我的疑问是 StrokingColor 代表什么，Non stroking color 代表什么。基于此，我将
pdfbox - 了解 PDFBox 2.0 中字体的加载
我终于成功地让 PDFBox 打印我的 unicodes。但现在，我想了解我提出的解决方案。下面的代码可以运行并将 ≥ 打印到页面上。有两件事不起作用: 改变PDType0Font.load(doc
pdfbox - 使用 PDFBOX 根据 PDF 中的输出识别文本
我正在使用 PDF BOX 获取 PDF 文本的颜色信息。我可以使用以下代码获得输出。但是我的疑问是 StrokingColor 代表什么，Non stroking color 代表什么。基于此，我将
pdfbox - 如何使用 Apache PDFBox 生成 Pdf 发票
我的项目要求在 Apache pdfbox api 的帮助下生成发票。截至目前，我可以在生成的 pdf 中插入图像、文本，但在生成表格时发现困难。我什至找不到单个示例模板。如果有人有请提供链接。注意
java - pdfbox PDFBox 2.0.0 获取字段位置
我如何使用 PDFBox 2.0.0 获取字段位置？在 Pdfbox 1.8.11 中，我是这样工作的: String formTemplate = "Template.pdf
pdfbox - 字体 ArialMT 中使用的 OpenType 布局表未在 PDFBox 中实现
我在我们的一个项目中使用了 CMS Magnolia。在日志文件中有很多错误，例如: 字体 ArialMT 中使用的 OpenType 布局表未在 PDFBox 中实现这对 PDF 有什么影响？可以
java - 从 PDFBox 1.x 迁移到 PDFBox 2
我一直在使用 PDFBox 1.8 来处理 pdf。现在我计划转向 PDFBox 2.0-RC-2。我在迁移时遇到一些问题。在 PDFBox 1.8 中，我曾经使用以下方法从 PDPage 获取 t
java - PDFbox 1.7.0 - 如何在使用 PDFBox 添加新图像的同时保留现有图像？
我正在使用 PDFBox 1.7.0(由于生产服务器中的版本较旧，我无法选择该版本)。我正在尝试将图像添加到已有 Logo 的现有 PDF 中。当我添加新图像时，旧图像就像被替换一样消失了。 // U
pdfbox - 如何在使用 Apache PDFBox 编写新 PDF 时将交互式 PDF 表单设置为只读模式？
我正在使用 Apache PDFBox 库在可填写的 PDF 表格 (AcroFrom) 中填写信息。完成信息填写后，我需要编写一个新的PDF文件(不可编辑格式)。我尝试了 setReadOnly
pdfbox - 登录 Apache PDFBox 2.0 时出现 "You did not close a PDF Document"
在对 PDDocument 进行数字签名后，我已关闭 Apache PDFBox 中的 PDDocument。我收到警告:当我关闭我的实例时，You did not close PDF Documen
pdfbox - java.lang.NoClassDefFoundError : Could not initialize class org. apache.pdfbox.pdmodel.font.PDFont
我在 wildfly 模块中使用 Apache Tika(tika-app 1.17)。当我开始提取 PDF 时，它总是抛出错误: java.lang.NoClassDefFoundError: Co
java - 如何使用 groovy 中的 pdfbox 进行编译(无法解析类 org.apache.pdfbox.util.Splitter )？
我尝试使用 pdfbox 并使用 groovy 进行编译，但我不知道这是我使用的代码 groovyc main.groovy 但不起作用，请帮助我 this.class.classLoader.ro
pdfbox - java.lang.NoClassDefFoundError : Could not initialize class org. apache.pdfbox.pdmodel.font.PDFont
我在 wildfly 模块中使用 Apache Tika(tika-app 1.17)。当我开始提取 PDF 时，它总是抛出错误: java.lang.NoClassDefFoundError: Co

首页

博学

6Ren·AI

商城

java - PdfBox - 使用获取字体信息