python - 将 pandas 数据框保存为图像或 pdf 文档中的表格，并具有良好的多索引显示-6ren

python - 将 pandas 数据框保存为图像或 pdf 文档中的表格，并具有良好的多索引显示

转载作者：行者123 更新时间：2023-11-28 17:26:59

我正在尝试在 pdf 报告中包含一个具有多索引的数据框。我想要一个漂亮的表格输出。

我找到了这两个解决方案:

pandas.df -> HTML -> pdf

    import pandas as pd
    from IPython.display import HTML
    import pdfkit

    # df generation
    df = pd.read_csv(path_to_csv, sep =',')
    groupeddf = df.groupby('Cluster')
    res = groupeddf.describe([0.05, 0.5, 0.95])
    res.index.rename(['Cluster', 'stats'], inplace=True)

    res['Cluster'] = res.index.get_level_values('Cluster')
    res['stats'] = res.index.get_level_values('stats')
    populations = (res.iloc[(res.index.get_level_values('stats') == 'count'), \
                                                            0].values).tolist()
    res['population'] = [populations[i] for i in res.index.labels[0].values()]
    total_pop = sum(populations)
    res['frequency'] =(res['population']/total_pop).round(3)
    res.set_index(['Cluster', 'population','frequency', 'stats'], inplace=True)



    res1 = res.iloc[(res.index.get_level_values('stats') == '5%') |
    (res.index.get_level_values('stats') == 'mean') |
    (res.index.get_level_values('stats') == '50%') |
    (res.index.get_level_values('stats') == '95%')]
    res1 = res1.round(2)
    # saving the df     
    h = HTML(res1.to_html())
    my_file = open('test.html', 'w')
    my_file.write(h.data)
    my_file.close()


    options = {
        'orientation': 'Landscape'
        }
    with open('test.html') as f:
        pdfkit.from_file(f, 'out.pdf', options=options)

但这对 pdfkit 有依赖性，这让我们很难。这就是我尝试使用 pandas.df -> tex -> pdf 的原因(如 Export a Pandas dataframe as a table image 中所述)

    import pandas as pd
    import os
    # df generation              
    df = pd.read_csv(path_to_csv, sep =',')
    groupeddf = df.groupby('Cluster')
    res = groupeddf.describe([0.05, 0.5, 0.95])
    res.index.rename(['Cluster', 'stats'], inplace=True)

    res['Cluster'] = res.index.get_level_values('Cluster')
    res['stats'] = res.index.get_level_values('stats')
    populations = (res.iloc[(res.index.get_level_values('stats') == 'count'), \
                                                            0].values).tolist()
    res['population'] = [populations[i] for i in res.index.labels[0].values()]
    total_pop = sum(populations)
    res['frequency'] =(res['population']/total_pop).round(3)
    res.set_index(['Cluster', 'population','frequency', 'stats'], inplace=True)



    res1 = res.iloc[(res.index.get_level_values('stats') == '5%') |
    (res.index.get_level_values('stats') == 'mean') |
    (res.index.get_level_values('stats') == '50%') |
    (res.index.get_level_values('stats') == '95%')]
    res1 = res1.round(2)
    res1.rename(columns=lambda x: x.replace('_', ' '), inplace=True)    

    #latex
    template = r'''\documentclass[preview]{{standalone}}
    \usepackage{{booktabs}}
    \begin{{document}}
    {}
    \end{{document}}
    '''

    with open("outputfile.tex", "wb") as afile: 
        afile.write(template.format(res1.to_latex()))
    os.system("pdflatex outputfile.tex")

但是，我不熟悉 latex ，我得到这个错误:

  ! LaTeX Error: File `standalone.cls' not found.

 Type X to quit or <RETURN> to proceed,
 or enter a new name. (Default extension: cls)

关于错误或执行 pandas.df -> pdf 的标准方法有什么想法吗？

最佳答案

对我有用的解决方案: Pandas >= 0.17我安装了pdflatex。我复制了 booktabs.sty、geography.sty 和 pdflscape.sty 等 latex 包

import pandas as pd
import os
import math

def save_summary_table_as_pdf(path_to_csv, path_to_output_folder):
    pwd = os.getcwd()
    df = pd.read_csv(path_to_csv, sep =',')

    #data preparation
    groupeddf = df.groupby('Cluster')
    res = groupeddf.describe([0.05, 0.5, 0.95])
    res.index.rename(['Cluster', 'Stats'], inplace=True)

    res['cluster'] = res.index.get_level_values('Cluster')
    res['stats'] = res.index.get_level_values('Stats')
    populations = (res.iloc[(res.index.get_level_values('Stats') == 'count'), \
                                                            0].values).tolist()
    res['population'] = [populations[i] for i in res.index.labels[0].values()]
    total_pop = sum(populations)
    res['frequency'] =(res['population']/total_pop).round(3)
    res.set_index(['cluster', 'population','frequency', 'stats'], inplace=True)
    res1 = res.iloc[(res.index.get_level_values('stats') == '5%') |
    (res.index.get_level_values('stats') == 'mean') |
    (res.index.get_level_values('stats') == '50%') |
    (res.index.get_level_values('stats') == '95%')]
    res1 = res1.round(2)
    res1.rename(columns=lambda x: x.replace('_', ' '), inplace=True)  

    #latex
    nbpages = int(math.ceil(res1.shape[0]*1.0/40))

    templatetop = r'''\documentclass[a3paper, 5pt]{article}
    \usepackage{booktabs}
    \usepackage{pdflscape}
    \usepackage[a4paper,bindingoffset=0.2in,%
            left=0.25in,right=0.25in,top=1in,bottom=1in,%
            footskip=.25in]{geometry}
    \begin{document}
    \begin{landscape}
    \pagenumbering{gobble}
    \oddsidemargin = 0pt
    \hoffset = -0.25in
    \topmargin = 1pt
    \headheight = 0pt
    \headsep = 0pt
    '''
    templatebottom = '''
    \end{landscape}
    \end{document}
    '''
    output_folder_path_abs = path_to_output_folder
    output_tex = os.path.join(output_folder_path_abs, 
    "clustering_summary_table.tex")

    with open(output_tex, "wb") as afile: 
        afile.write(templatetop +'\n')
        for i in range(0, nbpages):
            afile.write(res1.iloc[(i*40):((i+1)*40), :].to_latex() +'\n' + 
                                                """\pagenumbering{gobble}""")
        afile.write(templatebottom +'\n')
    os.chdir(output_folder_path_abs)
    os.system('pdflatex clustering_summary_table.tex')
    os.chdir(pwd)
    os.remove(output_tex)
    os.remove(os.path.join(path_to_output_folder, 
                                           'clustering_summary_table.aux'))
    os.remove(os.path.join(path_to_output_folder, 
                                           'clustering_summary_table.log'))

if __name__ == "__main__":
    print 'begin generate pdf table about clustering'
    import argparse
    parser = argparse.ArgumentParser()
    parser.add_argument("path_to_csv")
    parser.add_argument("outputfolder")
    args = vars(parser.parse_args())
    filedir = os.path.abspath(os.path.dirname(__file__))
    output_folder_path_abs = os.path.abspath(args['outputfolder'])
    input_folder_path_abs = os.path.abspath(args['path_to_csv'])
    # copy the user package latex to the folder
    os.system('scp '
    +os.path.abspath(os.path.join(filedir, 'userpackagelatex/booktabs.sty'))+
    ' ' +output_folder_path_abs)
    os.system('scp '
    +os.path.abspath(os.path.join(filedir, 'userpackagelatex/geography.sty'))+
    ' ' +output_folder_path_abs)
    os.system('scp '
    +os.path.abspath(os.path.join(filedir, 'userpackagelatex/pdflscape.sty'))+
    ' ' +output_folder_path_abs)
    save_summary_table_as_pdf(input_folder_path_abs, output_folder_path_abs)
    os.remove(os.path.join(output_folder_path_abs, 'booktabs.sty'))
    os.remove(os.path.join(output_folder_path_abs, 'geography.sty'))
    os.remove(os.path.join(output_folder_path_abs, 'pdflscape.sty'))

关于python - 将 pandas 数据框保存为图像或 pdf 文档中的表格，并具有良好的多索引显示，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/38095436/

文章推荐： javascript - 将对象的特定属性转换为对象数组

文章推荐： javascript - 获取位于同一对象中的函数的引用

文章推荐： javascript - 函数方法 .apply() .call() .bind()

java - float(具有 4 个字节的内存)可以在 Java 中保存 long(具有 8 个字节的内存)值。如何？
这是代码片段。请说出这种用小内存存储大数据的算法是什么。 public static void main(String[] args) { long longValue = 21474836
php - 当 Gmail IMAP 具有 utf8 而 Outlook 具有 ISO-8859-7 时，如何读取内容类型 header 并将其转换为 utf-8？
所以我使用 imap 从 gmail 和 outlook 接收电子邮件。 Gmail 像这样编码 =?UTF-8?B?UmU6IM69zq3OvyDOtc68zrHOuc67IG5ldyBlbWFpb
具有 2 个参数的计划过程
很久以前就学会了 C 代码；想用 Scheme 尝试一些新的和不同的东西。我正在尝试制作一个接受两个参数并返回两者中较大者的过程，例如 (define (larger x y) (if (> x
azure - 具有/不具有跨区域恢复的异地冗余恢复服务保管库有什么意义？
Azure 恢复服务保管库有两个备份配置选项 - LRS 与 GRS 这是一个有关 Azure 恢复服务保管库的问题。当其驻留区域发生故障时，如何处理启用异地冗余的恢复服务保管库？如果未为恢复服务启
hibernate - 具有@OneToMany属性的可嵌入实体
说，我有以下实体： @Entity public class A { @Id @GeneratedValue private Long id; @Embedded private
java - 具有 "in"运算符和空列表的条件
我有下一个问题。我有下一个标准: criteria.add(Restrictions.in("entity.otherEntity", getOtherEntitiesList())); 如果我的
Java - 具有 If 语句打印顺序错误的主方法
如果这是任何类型的重复，我会提前申请，但我找不到任何可以解决我的具体问题的内容。这是我的程序: import java.util.Random; public class CarnivalGame{
database - 具有$ setIntersection的Mongodb聚合管道
我目前正在使用golang创建一个聚合管道，在其中使用“$ or”运算符查询文档。结果是一堆需要分组的未分组文档，这样我就可以进入下一阶段，找到两个数据集之间的交集。然后将其用于在单独的集合中进行
java - 具有 Or 条件的正则表达式？
是否可以在正则表达式中创建 OR 条件。我正在尝试查找包含此类模式的文件名列表的匹配项第一个案例 xxxxx-hello.file 或者案例二 xxxx-hello-unasigned.file
c - 具有 `for` 循环的菱形输出
该程序只是在用户输入行数时创建菱形的形状，因此它有 6 个 for 循环； 3 个循环创建第一个三角形，3 个循环创建另一个三角形，通过这 2 个三角形和 6 个循环，我们得到了一个菱形，这是整个程序
c# - 具有 "&"的查询字符串值
我有一个像这样的查询字符串 www.google.com?Department=Education & Finance&Department=Health 我有这些 li 标签，它们的查询字符串是这样
c# - 具有/不同配置值的单元测试静态构造函数
我有一个带有静态构造函数的类，我用它来读取 app.config 值。如何使用不同的配置值对类进行单元测试。我正在考虑在不同的应用程序域中运行每个测试，这样我就可以为每个测试执行静态构造函数 - 但我
c++ - 具有 OR 搜索功能的多键容器
我正在寻找一个可以容纳多个键的容器，如果我为其中一个键值输入保留值(例如 0)，它会被视为“或”搜索。 map, int > myContainer; myContainer.insert(make_
mysql - 具有/多种类型的单个对象的关系表设计
我正在为 Web 应用程序创建数据库，并正在寻找一些建议来对可能具有多种类型的单个实体进行建模，每种类型具有不同的属性。作为示例，假设我想为“数据源”对象创建一个关系模型。所有数据源都会有一些共享属
arrays - 具有 IN 条件的存储过程语法
(1) =>CREATE TABLE T1(id BIGSERIAL PRIMARY KEY, name TEXT); CREATE TABLE (2) =>INSERT INTO T1 (name)
sql - 具有 AS 别名的不明确列引用
我不确定在使用别名时如何解决不明确的列引用。假设有两个表，a 和 b，它们都有一个 name 列。如果我加入这两个表并为结果添加别名，我不知道如何为这两个表引用 name 列。我已经尝试了一些变体，
mysql - 具有 IN 条件的自定义订单
我的查询是: select * from table where id IN (1,5,4,3,2) 我想要的与这个顺序完全相同，不是从1...5，而是从1,5,4,3,2。我怎样才能做到这一点？最
c# - 具有@符号的列名
我正在使用 C# 代码执行动态生成的 MySQL 查询。抛出异常: CREATE TABLE dump ("@employee_OID" VARCHAR(50)); "{"You have an er
java - 具有 + 号的日期格式问题
我有日期 2016-03-30T23:59:59.000000+0000。我可以知道它的格式是什么吗？因为如果我使用 yyyy-MM-dd'T'HH:mm:ss.SSS，它会抛出异常最佳答案 Sim
MYSQL - 具有 in 子句的删除查询中的语法错误
我有一个示例模式，它的 SQL Fiddle 如下: http://sqlfiddle.com/#!2/6816b/2 这个 fiddle 只是根据 where 子句中的条件查询示例数据库，如下所示:

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

python - 将 pandas 数据框保存为图像或 pdf 文档中的表格，并具有良好的多索引显示