gpt4 book ai didi

python - Camelot Pdf 提取失败解析

转载 作者:行者123 更新时间:2023-12-01 13:13:02 27 4
gpt4 key购买 nike

我遇到了 Camelot 库的问题

我正在从 PDF 中提取数据,我的代码在前 23 页上运行“正常”,但对于这种情况,它无法解析文本/表格结尾

我想问题是字符串太长到达表格边界

也试过“stream”但结果最差

PDF 源数据

pdf

PDF 输出布局

layout

我解析的输出是这样的

"ALT4945\n24 V"
"70\/140 A ALT5860\n12 V\n90 A"

期望的输出应该是

"ALT4945\n24 V 70\/140 A"
"ALT5860\n12 V\n90 A"

我的第一个对上一页正确工作的代码是

tables = camelot.read_pdf("CROSSREFERENCE.pdf", pages=wPAGES, flavor="lattice")

来自网站 Camelot Doc https://camelot-py.readthedocs.io/en/master/api.html我在 pdf 解析器上得到了那个可能的配置。

"" PARAMS for lattice
line_scale (default: 15)
copy_text ((default: None))
shift_text (default: ['l', 't'])
line_tol (default: 2)
joint_tol (default: 2)
threshold_blocksize (default: 15)
threshold_constant (default: -2)
iterations (default: 0)
resolution (default: 300)
"""

然后我遇到了那个问题,试图用更多的参数来解决“玩”,但没有找到赢家

tables = camelot.read_pdf("CROSSREFERENCE.pdf", pages=wPAGES, flavor="lattice", split_text=True, resolution=720, line_scale=250, line_tol=3, joint_tol=3, threshold_blocksize=15)

tables = camelot.read_pdf("CROSSREFERENCE.pdf", pages=wPAGES, flavor="lattice", split_text=True, resolution=720, line_scale=250, line_tol=1, joint_tol=1, threshold_blocksize=3)

我能得到一些关于参数的建议来避免这种情况吗??

谢谢

编辑1:PDF 来源:https://www.siom.it/images/catalogo-motorini-alter.pdf(第24页)

最佳答案

测试解决方案

tables = camelot.read_pdf('./catalogo-motorini-alter.pdf', pages='24', 
flavor='stream', columns=['300'], split_text=True)

tables[0].df 的输出如下:

                                         0                                                  1
0 CATALOGO SIOM ALTERNATORI BOSCH \nBOSCH \nBOSCH \nBOSCH
1 ALT4800\n12 V\n65A ALT4830\n12 V\n70 A
2 IMPIANTO : BOSCH\nCOD.OEM : 0120489186 IMPIANTO : BOSCH\nCOD.OEM : 0120488172
3 APPLICAZIONI :\n OPEL VAUXHALL APPLICAZIONI :\n OPEL VAUXHALL
4 ALT4840\n12 V\n70 A ALT4890\n12 V\n90 A
5 IMPIANTO : BOSCH\nCOD.OEM : 0120488186 IMPIANTO : BOSCH\nCOD.OEM : 0123315500
6 APPLICAZIONI :\n OPEL VAUXHALL APPLICAZIONI :\n IVECO
7 ALT4900\n12 V\n90 A ALT4940\n24 V\n70/140 A
8 IMPIANTO : BOSCH\nCOD.OEM : 0123320009 IMPIANTO : BOSCH\nCOD.OEM : 0120689535
9 APPLICAZIONI :\n AUDI SKODA VW APPLICAZIONI :\n DROGMOLLER KASSBOHRER MERCEDE...
10 ALT4945\n24 V\n70/140 A ALT5860\n12 V\n90 A
11 IMPIANTO : BOSCH\nCOD.OEM : 0120689541 IMPIANTO : BOSCH\nCOD.OEM : 0120450011
12 APPLICAZIONI :\n MAN MERCEDES BENZ APPLICAZIONI :\n CHRYSLER
13 ALT6600\n12 V\n90 A ALT6610\n24 V\n80 A
14 IMPIANTO : BOSCH\nCOD.OEM : 0124325058 IMPIANTO : BOSCH\nCOD.OEM : 0124555001
15 APPLICAZIONI :\n FIAT LANCIA APPLICAZIONI :\n MERCEDES BENZ
16 Pag .24

说明

来自docs对于共享文档,stream 解析器似乎比 lattice 更适合:

Stream can be used to parse tables that have whitespaces between cellsto simulate a table structure.

对于 stream 解析器发现不正确的列分隔符的情况,您可以在 columns 参数 ( details ) 中手动指定它们。然后 split_text 选项 says用这些列拆分文本:)

讨论

尽管fpbhb在评论中批评 抓取 PDF,我对你的具体情况相当乐观。您共享的文档结构合理。所以我肯定会尝试解析它。但是点fpbhb仍然正确,它是启发式的。因此,需要采取额外的预防措施。

我建议你使用regular expressions测试你从 camelot 得到了什么。

您可以使用以下代码作为起点:

import re
import logging

def test_tables(tables):
# headers
HEADER_L = re.compile('^CATALOGO SIOM ALTERNATORI$')
HEADER_R = re.compile('^BOSCH \nBOSCH \nBOSCH \nBOSCH$')

# main cell rows
CELL_ROWS = [
re.compile('^ALT\d{4,6}?\n(12|14|24|28) ?V\n\d{2,3}(/\d{2,3})? ?A$'),
re.compile('^IMPIANTO : .*?\nCOD.OEM : [\dA]{9,10}$'),
re.compile('^APPLICAZIONI :(\n[A-Z \.-]*)?$')
]

# bottom line should be Pag.##
PAGE = re.compile('^Pag.\d{1,3}$')

for ti, table in enumerate(tables):
rows = table.df.to_numpy()
# test headers
if not HEADER_L.match(rows[0, 0]):
logging.warning('tables[{}].df.iloc[0][0]: HEADER_L != {}'.format(ti, rows[0, 0]))
if not HEADER_R.match(rows[0, 1]):
logging.warning('tables[{}].df.iloc[0][1]: HEADER_R != {}'.format(ti, rows[0, 1]))

# test bottom line
page_str = ''.join(rows[-1])
if not PAGE.match(page_str):
logging.warning('tables[{}].df.iloc[-1]: PAGE != {}'.format(ti, page_str))

# test cells
for idx, row in enumerate(rows[1:-1]):
row_idx = idx % 3
pattern = CELL_ROWS[row_idx]
if not pattern.match(row[0]):
logging.warning('tables[{}].df.iloc[{}][0]: ROW {} != {}'.format(ti, idx+1, row_idx, row[0]))
if not pattern.match(row[1]):
logging.warning('tables[{}].df.iloc[{}][1]: ROW {} != {}'.format(ti, idx+1, row_idx, row[1]))

测试前 24 页

pages_till_24 = ','.join([str(i) for i in range(1,25)])
tables = camelot.read_pdf('./catalogo-motorini-alter.pdf', pages=pages_till_24,
flavor='stream', columns=['300'], split_text=True)
test_tables(tables)

它只给出一个无关紧要的警告(额外的空格)

WARNING:root:tables[8].df.iloc[7][1]: ROW 0 != ALT122300
12 V
45 A

结论

好吧,看来你可以高兴了,因为它似乎可以工作,而且你有代码来测试其他页面。祝你好运:)

关于python - Camelot Pdf 提取失败解析,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/58837504/

27 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com