pandas - 将 kdb 表保存到数据帧，然后将数据帧保存到 csv。 null 和字符串值错误地输出到 csv？-6ren

pandas - 将 kdb 表保存到数据帧，然后将数据帧保存到 csv。 null 和字符串值错误地输出到 csv？

转载作者：行者123 更新时间：2023-12-02 19:54:58

28

4

我将 kdb 表保存到数据帧，然后将数据帧保存到 csv。但是，这适用于 csv 文件，并且如果我打印(数据帧)； null 值显示为“b” ”，所有其他字符串值显示为“b'STRING' ”。

运行 Python 3.7、pandas 0.24.2 和 qpython 2.0.0。

df = pandas.DataFrame(qpython query)
df.to_csv(path_or_buf="",
          sep=",", na_rep='',
          float_format=None,
          columns=None,
          header=True, index=False,
          index_label=None, mode='w+', compression=None, quoting=None, quotechar='"',
          line_terminator="\n", chunksize=50, tupleize_cols=None, date_format=None,
          doublequote=True,
          escapechar=None, decimal='.', encoding='utf-8')

我希望 KDB 表能够正确输出到 csv，其中 null 为空列，字符串仅显示字符串，没有“b'STRING' ”。

任何建议或帮助将不胜感激。如果有人需要更多信息，我很乐意提供。

csv 中的示例:

空单元格显示为:b"

包含字符串的单元格显示为:“b'Euro'”，而实际上应该只显示“Euro”

最佳答案

qPython 具有一些将 kdb 表转换为 pandas 数据帧的功能。我首先在 kdb "t"中创建一个表，该表有 4 列，其中第三列是符号列，第四列是字符列。第一行中的条目完全为空。

t:([] a: 0N, til 99; b: 0Nf, 99?1f; c: `, 99?`3; d: " ", 99?" ")
a b         c   d
-----------------

0 0.4123573 iee x
1 0.8397208 app l
2 0.3392927 ncm w
3 0.285506  pjn c

然后可以使用 QConnection 将表读入 Python。如果我们在读入表后将其转换为数据帧，我们可以看到符号和字符已转换为字节，而空值未正确转换。

df=pandas.DataFrame(q('t'))
df.head()
                       a           b         c     d
0   -9223372036854775808         NaN       b''  b' '
1                      0    0.412357    b'iee'  b'x'
2                      1    0.839721    b'app'  b'l'
3                      2    0.339293    b'ncm'  b'w'
4                      3    0.285506    b'pjn'  b'c'

但是，如果我们在 q 查询中使用 pandas=True 参数，那么大部分表都会根据需要进行适当转换:

df=q('t', pandas=True)
df.head()
      a        b         c  d
0   NaN      NaN       b''  
1   0.0 0.412357    b'iee'  x
2   1.0 0.839721    b'app'  l
3   2.0 0.339293    b'ncm'  w
4   3.0 0.285506    b'pjn'  c

但是请注意，在 kdb 中存储为符号的条目不会根据需要进行转换。在这种情况下，以下代码将使用与 Callum 建议的类似方法手动将 string_cols 中指定的任何列从字节解码为字符串。

string_cols = ['c']
df[string_cols] = df[string_cols].applymap(lambda s : s.decode('utf-8'))

给出最终结果:

df.head()
      a        b      c d
0   NaN      NaN        
1   0.0 0.412357    iee x
2   1.0 0.839721    app l
3   2.0 0.339293    ncm w
4   3.0 0.285506    pjn c

可以轻松转换为 csv 文件。

希望这有帮助

关于pandas - 将 kdb 表保存到数据帧，然后将数据帧保存到 csv。 null 和字符串值错误地输出到 csv？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/57268769/

28

4

0

文章推荐： reactjs - 在按钮单击事件上调用组件

文章推荐： arrays - 如何在 Presto 中比较两个数组？

文章推荐： postgresql - postgres 从 10.9 升级到 11.4 失败 (aws rds)

文章推荐： json - 如何解析包含键值对的 JSON 对象？

kdb - kdb 中的并行处理
当我们使用 -s 时，主线程将一些工作委托(delegate)给从线程。我在带有 3 个从属线程的 session 上运行以下代码:q -s 3 select from t where date w
kdb - 根据字符数组列的值进行选择 - KDB
我有一个像这样构建的表: tab: ([]col1:();col2:()) `tab insert (`testsym; "testchararr") 我现在想选择 col2 所在的行具有值 "tes
kdb - 添加基于其他列的列 KDB+
我有一个包含许多列的表(“ibmqt”)，我想添加一个新列，其中包含 bool 值，指示每一行的一列(“bid”)是否大于或等于另一列列(“询问”)。到目前为止，我最成功的尝试是: ibmqt: u
kdb - KDB+ 中具有多个值列的数据透视表
我想改造以下两行表格生成的: tb: ([] time: 2010.01.01 2010.01.01; side:`Buy`Sell; price:100 101; size:30 50) time
kdb - kdb 中的垂直输出
kdb有垂直输出吗？在 ClickHouse 中我可以指定 FORMAT VERTICAL SELECT * FROM foo FORMAT VERTICAL; Row 1: ────── date:
kdb - 从日期字段获取月份 - KDB
我将销售数据存储在数据库中。 sales_date 字段包含销售发生的日期。我想提取按月分组的数据，以便获得一月、二月等的汇总数据。有没有一种方法可以做到这一点，而不必提取整个数据然后手动执行？最佳
kdb - kdb 中的垂直输出
kdb有垂直输出吗？在 ClickHouse 中我可以指定 FORMAT VERTICAL SELECT * FROM foo FORMAT VERTICAL; Row 1: ────── date:
kdb - 从日期字段获取月份 - KDB
我将销售数据存储在数据库中。 sales_date 字段包含销售发生的日期。我想提取按月分组的数据，以便获得一月、二月等的汇总数据。有没有一种方法可以做到这一点，而不必提取整个数据然后手动执行？最佳
kdb - kdb 速度快仅仅是因为在内存中进行处理吗
我曾多次听到人们谈论 KDB 几乎可以在短时间内处理数百万行数据。为什么这么快？这仅仅是因为数据都组织在内存中吗？另一件事是有替代方案吗？有大型数据库供应商提供内存数据库吗？最佳答案快速 Goo
kdb - kdb 中列表列的加权平均值
如何从 kdb 中每行有多个条目的其他 2 列计算一列加权平均值？例如，给定下表: T:([]sym:`a`b`c;size:(2 8;5 2 10;3 7);price:(1 2;1 1 10;2
kdb - 如何通过迭代多个列表来生成数据表？ (KDB)
我有一个功能 quotes[ticker;startDate;endDate] ，以及一个函数 indexConstituents[index;startDate;endDate]产生以下内容: da
KDB 字符串到 kdb `timestamp`
kdb 凡人/众神!! 我有一个日期时间字符串数组，但格式不同 > leads[`firstConversion] "Wed May 20 2020 08:56:54 GMT-0700 (PDT)"
kdb - KDB/Q 中行之间的差异
我是 KDB/Q 的新手，对获取两行(不一定相邻)之间的差异有疑问。我只有一张表，如下所示: q)tickers:`ibm`bac`dis`gs`ibm`gs`dis`bac q)pxs:100 5
kdb - 如何在 KDB 表列中填充空值？
q)t:flip `name`iq!(`Dent``Prefect;98 32 34) q)t name iq ---------- Dent 98 32 Prefect
kdb - 在 kdb 中插入一条有很多空值的记录
假设我只想插入第一列和其他列为空。最快的方法是什么？并且可能有不同的类型。假设有 10 列。这是我能想到的: `tab insert (`abcd;`;"";`;"";"";`;`;`;`;`;`)
kdb - 在 KDB 中扫描二进制应用程序？
我试图理解这一点: 100+\ 1 2 3 101 103 106 效果很好。问题 1: 当我将它括在方括号中时，我得到了一个我没有预料到的错误: (100+\) 1 2 3 'Cannot wri
kdb - 在 KDB 中选择时间跨度值的问题
我在选择以下时间跨度时遇到问题: t:([] date:2#.z.d ; time: 10D21:28:47.425287000 10D12:18:23.287989000 ) date
kdb - 如何以方便的方式在 kdb 中创建日期列表？
有什么方法可以输入两个日期，然后会创建一个包括他们自己在内的日期列表？例如。我要 2017.01.01 2017.01.02 .... 2017.01.10 我现在做的是 2017.01.01 +
kdb - 如何对 KDB 中加载的展开表执行？
我通过 .Q.dpft[] 将一张张开的表格写入磁盘。使用 \l 系统命令加载此表后，我可以从该表中 select，例如，select column_name from splayed_table w
kdb - 根据现有列向 kdb 中的表添加列？
我想在 kdb 表中添加一个新列，它应该基于现有列通过填充非空值来添加，如下所示 q)t:([]a:`a`b`c`d`e`f`g`h;b:1 0n 3 4 0n 6 0n 8;c:0n 2 0n 0n

首页

博学

6Ren·AI

商城

pandas - 将 kdb 表保存到数据帧，然后将数据帧保存到 csv。 null 和字符串值错误地输出到 csv？