gpt4 book ai didi

python - 在python中使用tabulizer循环遍历pdf文件

转载 作者:太空宇宙 更新时间:2023-11-03 15:08:07 26 4
gpt4 key购买 nike

我很难让一段代码正常工作。我想循环遍历文件夹中的 pdf 文件,提取 tabula 包认为表格的内容,将它们提取到数据帧,然后将特定 pdf 中的所有表格写入一个 csv 文件。

我查看了this post (以及其他几个)但我仍然无法使其正常工作。脚本似乎循环遍历文件,提取一些表,但它似乎没有迭代文件,而且我无法让它将所有数据帧写入 csv 文件。该脚本仅写入 csv 中的最后一个。

这就是我到目前为止所拥有的。任何帮助将不胜感激,特别是如何正确循环文件以及如何将一份 pdf 中的所有表格写入一个 csv 文件。我被困住了...

pdf_folder = 'C:\\PDF extract\\pdf\\'
csv_folder = 'C:\\PDF extract\\csv\\'

paths = [pdf_folder + fn for fn in os.listdir(pdf_folder) if fn.endswith('.pdf')]
for path in paths:
listdf = tabula.read_pdf(path, encoding = 'latin1', pages = 'all', nospreadsheet = True,multiple_tables=True)
path = path.replace('pdf', 'csv')
for df in listdf: (df.to_csv(path, index = False))

最佳答案

就像@Scott Hunter提到的那样,您没有使用CSV_folder

此外,我认为您正在覆盖创建的 .csv 文件:

对于 listdf 中的 df:(df.to_csv(path, index = False))

对于 for 循环的每次迭代,路径变量保持不变。

编辑:你可能应该尝试做这样的事情:

pdf_folder = 'C:\\PDF extract\\pdf\\'
paths = [pdf_folder + fn for fn in os.listdir(pdf_folder) if fn.endswith('.pdf')]

for path in paths:
listdf = tabula.read_pdf(path, encoding = 'latin1', pages = 'all', nospreadsheet = True,multiple_tables=True)
path = path.replace('pdf', 'csv')
df_concat = pd.concat(listdf)
df_concat.to_csv(path, index = False)

关于python - 在python中使用tabulizer循环遍历pdf文件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/44464436/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com