java - 解析银行对账单 PDF-6ren

java - 解析银行对账单 PDF

转载作者：行者123 更新时间：2023-11-30 06:13:39

我有几张来 self 们用户的银行对账单。我正在尝试找出一种解析交易行的方法。我之前使用过 PDFBox，使用 TextArea、TextStripper，但我不确定如何处理银行对账单，因为它们的行数不确定，并且行的大小可能固定，也可能不固定。

最佳答案

在一个名为 Apache Tika 的开源项目的帮助下，我编写了这样一个解析器来解析我们的 Chase pdf 信用卡报表，以加快报税时间。

只需要在 pom.xml 依赖项中包含 tika 和 pdf 解析器:

        <dependency>
            <groupId>org.apache.tika</groupId>
            <artifactId>tika-core</artifactId>
            <version>1.17</version>
        </dependency>
        <dependency>
            <groupId>org.apache.tika</groupId>
            <artifactId>tika-parsers</artifactId>
            <version>1.17</version>
        </dependency>

PDF 提取器也相当简单:

import org.apache.tika.metadata.Metadata;
import org.apache.tika.parser.ParseContext;
import org.apache.tika.parser.pdf.PDFParser;
import org.apache.tika.sax.BodyContentHandler;
import org.slf4j.Logger;
import org.slf4j.LoggerFactory;
import org.xml.sax.ContentHandler;

import java.io.FileInputStream;
import java.io.InputStream;
import java.util.ArrayList;
import java.util.List;


public class PdfExtractor {
    private static Logger logger = LoggerFactory.getLogger(PdfExtractor.class);

    public static void main(String args[]) throws Exception {
        StopWatch sw = new StopWatch();
        List<String> files = new ArrayList<>();
        files.add("C:/Users/m/Downloads/20170115.pdf");
        files.add("C:/Users/m/Downloads/20170215.pdf");
        files.add("C:/Users/m/Downloads/20170315.pdf");
        files.add("C:/Users/m/Downloads/20170415.pdf");
        files.add("C:/Users/m/Downloads/20170515.pdf");
        files.add("C:/Users/m/Downloads/20170615.pdf");
        files.add("C:/Users/m/Downloads/20170715.pdf");
        files.add("C:/Users/m/Downloads/20170815.pdf");
        files.add("C:/Users/m/Downloads/20170915.pdf");
        files.add("C:/Users/m/Downloads/20171015.pdf");
        files.add("C:/Users/m/Downloads/20171115.pdf");
        files.add("C:/Users/m/Downloads/20171215.pdf");
        files.add("C:/Users/m/Downloads/20180115.pdf");
        InputStream is;
        List<ChasePdfParser.ChaseRecord> full = new ArrayList<>();
        for (String fileName : files) {
            logger.info("Now processing " + fileName);
            is = new FileInputStream(fileName);
            ContentHandler contenthandler = new BodyContentHandler();
            Metadata metadata = new Metadata();
            PDFParser pdfparser = new PDFParser();
            pdfparser.parse(is, contenthandler, metadata, new ParseContext());
            String data = contenthandler.toString();
            List<ChasePdfParser.ChaseRecord> chaseRecords = ChasePdfParser.parse(data);
            full.addAll(chaseRecords);
            is.close();
        }
        logger.info("Total processing time: " + PrettyPrinter.toMsSoundsGood(sw.getTime()));
        full.forEach(cr -> System.err.println(cr.date + "|" + cr.desc + "|" + cr.amt));
    }
}

行解析器也相当简单，因为每一行都有所有必要的信息，所以很容易解析它:

import org.slf4j.Logger;
import org.slf4j.LoggerFactory;

import java.time.LocalDate;
import java.time.format.DateTimeFormatter;
import java.util.ArrayList;
import java.util.Arrays;
import java.util.List;

public class ChasePdfParser {
    private static Logger logger = LoggerFactory.getLogger(ChasePdfParser.class);

    private static int FOR_TAX_YEAR = 2017;
    private static String YEAR_EXTENSION = "/" + FOR_TAX_YEAR;
    private static DateTimeFormatter check = DateTimeFormatter.ofPattern("MM/dd/uuuu");
    private static List<String> exclusions = new ArrayList<>(Arrays.asList("Payment Thank You", "AUTOMATIC PAYMENT"));

    public static List<ChaseRecord> parse(String data) {
        List<ChaseRecord> l = new ArrayList<>();
        for (String line : data.split("\n")) {
            if (line.isEmpty()) continue;
            String[] split = line.split("\\s");
            if (split == null || split.length == 0) continue;
            String test = split[0];
            if (!isMMDD(test)) continue;
            if(skip(line)) continue;
            if (split.length < 4) continue;
            ChaseRecord cr = new ChaseRecord();
            cr.date = extractDate(test);
            try {
                String last = split[split.length - 1];
                last = last.replaceAll(",", "");
                cr.amt = Double.parseDouble(last);
            } catch (NumberFormatException e) {
                e.printStackTrace();
            }
            cr.desc = String.join(" ", Arrays.copyOfRange(split, 1, split.length - 1));
            cr.desc = cr.desc.replaceAll("\\s\\s+", " ");
            l.add(cr);
        }
        return l;
    }

    private static boolean skip(String s) {
        if (s == null || s.isEmpty()) {
            return true;
        }
        for (String e : exclusions) {
            if (s.contains(e)) {
                return true;
            }
        }
        return false;
    }

    protected static LocalDate extractDate(String s) {
        if (!isMMDD(s)) {
            return null;
        }
        LocalDate localDate = LocalDate.parse(s + YEAR_EXTENSION, check);
        return localDate;
    }

    public static boolean isMMDD(String s) {
        if (s == null || s.isEmpty() || s.length() != 5) {
            return false;
        }
        try {
            s += YEAR_EXTENSION;
            LocalDate.parse(s, check);
            return true;
        } catch (Exception e) {
            return false;
        }
    }

    public static class ChaseRecord {
        public LocalDate date;
        public String desc;
        public Double amt;

        @Override
        public String toString() {
            return "ChaseRecord{" +
                    "date=" + date +
                    ", desc='" + desc + '\'' +
                    ", amt=" + amt +
                    '}';
        }
    }
}

关于java - 解析银行对账单 PDF，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49708828/

文章推荐： java - 进程运行时在窗口中显示计时器

文章推荐： java - do while 循环提示用户输入一些内容

文章推荐： java - Spring不创建ConstraintValidator

文章推荐： java - 用 Java 编写通用迭代器

pdf - 将多个 PDF 合并为一个 PDF
我的代码有一些问题。我正在尝试遍历包含许多 PDF 的 Drive 文件夹，然后将它们合并为一个文件。当我使用我的代码时，它只是为 Drive 文件夹中的最后一个 PDF 创建一个 PDF，而不是按预
pdf - PDF 规范中的最小 PDF 示例
我从 PDF Specification 获取了 PDF 规范中的最小 PDF 示例。，将其复制到记事本，将文件重命名为扩展名为 .pdf。我可以用其他 PDF 查看器(PDF-XChange、S
pdf - 在不破坏可访问性或 PDF 标签的情况下连接 PDF
感谢您在以下方面的帮助: 我有 2 个部分可访问的 PDF(包含标签)，我想使用一些命令行工具(如 PDFtk 或 Ghostscript，或任何 Perl 模块)将它们连接起来: 我已经尝试使用 P
pdf - Ghostscript - 将矢量 pdf 转换为光栅 pdf
我想使用 ghostscript 将矢量 pdf 转换为光栅 pdf(即光栅化矢量 pdf)。但是即使我添加了解析参数 -r300，我也找不到合适的参数来执行此操作。我使用的代码是-dSAFER -
pdf - iTextSharp 可以将 PDF 文档转换为 PDF/A
我无法在 FAQ 中找到这个功能是否存在于 API 中，尽管它在书中提到作为潜在可用的东西。有没有人有任何实现此功能的经验？最佳答案在 This thread (日期为 2007 年 6 月)Pa
pdf - 使用 pdf.js 在网站上显示 PDF
我要放文件sample.pdf在我的网站上，并希望使用 pdf.js 显示它.我想要的是显示我自己的文件，如 demo ，带有工具栏，放大/缩小等。到目前为止，我还不能这样做。我确实检查了 hell
pdf - 将 PDF 转换为 PDF/A-1
我知道这可能不是严格意义上的编程问题(也许是，我不知道)但我在尝试转换常规 pdf(带有超链接、书签、图像、嵌入字体等)时遇到了严重问题.) 转换为 PDF/A-1 格式。当我用 pdfaPilot
PDF.js 能够创建 pdf 文件或 PDF.js 只是一个让 PDF 文件显示在网络浏览器上的功能？
这是 PDF.js 网站 https://github.com/mozilla/pdf.js 我正在搜索和阅读很多文章，大多数编码都是将 pdf 导入 pdf.js 并在浏览器上显示，我不明白是不是
pdf-generation - 扫描图像/PDF 到可搜索图像/PDF
谁能建议我如何将扫描图像转换为可搜索图像或如何将扫描 pdf 转换为可搜索 pdf？很长一段时间以来，我一直陷入这种情况。我已经在 ubuntu 中尝试过 pdfocr 应用程序，但没有成功。最
pdf - Itext pdf 延迟签名导致 pdf 签名无效
作为我对客户端/服务器 pdf 签名研究的一部分，我测试了 itext pdf 延迟签名示例。不幸的是，我生成的 pdf 即合并空签名 pdf 和哈希值的输出显示无效签名。我的代码片段如下 cla
pdf - 在 PDF 中插入 PDF(不合并文件)
我想将一个 PDF 页面插入到另一个已缩放的 PDF 页面中。我想使用 iTextSharp 来实现此目的。我有一个矢量绘图，可以导出为单页 PDF 文件。我想将此文件添加到其他 PDF 文档的页面
pdf - Itext pdf 延迟签名导致 pdf 签名无效
作为我对客户端/服务器 pdf 签名研究的一部分，我测试了 itext pdf 延迟签名示例。不幸的是，我生成的 pdf 即合并空签名 pdf 和哈希值的输出显示无效签名。我的代码片段如下 cla
pdf - 裁剪基于文本的多页 PDF 文档的白边并将其转换为基于图像的 PDF 文档
我想为 Kindle 转换电子书。我尝试使用 Calibre 将具有复杂格式样式和图像的基于两种语言的基于文本的大型 PDF 电子书转换为适用于 Kindle 的 AZW3 电子书，并且还尝试了亚马逊
pdf - 如何仅使用 Adobe PDF 插件强制在谷歌浏览器中显示 PDF
我在 Google Chrome 中显示 pdf 时遇到问题。问题是 Chrome 将 pdf 的某些页面显示为黑色。启用 Chrome PDF 查看器时会发生这种情况。如果我禁用此插件并使用 Ad
pdf - 打印时将空白页插入 PDF
我确信这个问题无处不在，尽管我似乎找不到答案。我希望我的 PDF 文档在 PDF 阅读器中显示时没有空白页，但随后在封面后打印空白页，这样打印出来的文档在右侧甚至左侧都有奇数页。还有其他人遇到过这个问
pdf - 从命令行自动裁剪 pdf
我需要自动裁剪 pdf 文件(去除白边)。到目前为止，我尝试了两种并不完美的工具: pdf裁剪问题:它不会裁剪某些 pdf。 pdf-crop-margins 问题:有时它裁剪得太多(精细的细节)。
pdf - PDF 中的透明图像
This PDF由几个源文件组成。其中五个是包含 alpha channel 的 PNG。一种是没有 alpha channel 的 PNG。最后一 block 是带有透明效果的 Photoshop
pdf - 将内部维基页面转换为 PDF
我的团队将内部 wiki 页面用于各种内容。这些页面是使用 MediaWiki 创建的。我想知道是否有任何方法可以将 wiki 页面转换为 PDF 格式。我必须用它来将用户文档转换为 PDF 格式，以
pdf - 从结构化数据生成 PDF
我希望能够从我可能在数据库或 xml 或任何其他结构化形式中拥有的数据生成高度图形化(也包含大量文本内容)的 PDF 文件。目前，我们的平面设计师在将内容作为 MS Word 文档后，在 Photo
pdf - 查找重复的 PDF
我正在寻找可以帮助我找到重复 PDF 的实用程序。问题:我有 1000 个 PDF 文件。有些是重复的。由于不同的文件名和文件大小的微小差异，它们不容易被检测到。是否有实用程序/算法/库可以帮助我找到

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

java - 解析银行对账单 PDF