- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个以下示例数据帧:
| id | lang | text |
_______________________________
| "1" | "en" | "text1" |
| "2" | "ua" | "text2" |
| "1" | "en" | "text3" |
| "2" | "en" | "text4" |
| "3" | "en" | "text5" |
| "4" | "ru" | "text6" |
| "4" | "en" | "text7" |
| "3" | "ua" | "text8" |
我需要按 ID 和语言对其进行分组,并将文本作为单独的列表输出。
上面 DataFrame 的输出应如下所示:
应该有一个唯一 ID 的列表:[1,2,3,4]
对于 lang 列中的每种语言,应该有一个单独的列表,其中包含来自 text 列的文本以及唯一 ID 列表的长度,在本例中,如果每个 ID 有多个文本,然后将它们连接起来(例如通过空格)。因为在示例 DF 中我们有 3 种语言:en、ua、ru;我们需要 3 个列表:
ids = [ 1, 2, 3, 4 ] # <-- list of IDs for reference
en = ["text1 text3", "text4", "text5", "text7"]
ua = ["", "text2", "text8", "" ]
ru = ["", "", "", "text6"]
文本列表应与ID列表一样长,如果一个ID有多个文本,则应将它们连接起来,如果没有则写入一个空字符串。
到目前为止我有这个Python解决方案:
import pandas as pd
my_table = pd.read_csv("my_data.csv", delimiter="\t")
en = list()
ua = list()
ru = list()
# iterate over unique ids only
for single_id in list(my_table.cluster_id.unique()):
# append a concatenated list of all texts given id and lang
en.append(" ".join(list(
my_table[(my_table["id"]==unicode(id))&(my_table["lang"]==unicode("en"))]["text"]
)))
ua.append(" ".join(list(
my_table[(my_table["id"]==unicode(id))&(my_table["lang"]==unicode("ua"))]["text"]
)))
de.append(" ".join(list(
my_table[(my_table["id"]==unicode(id))&(my_table["lang"]==unicode("ru"))]["text"]
)))
这相当慢。有什么方法可以先在 Pandas 中进行过滤,然后以某种方式快速将其输出到单独的列表中?我需要 Python 列表作为输出。
编辑:这是在 Python 2.7 上
最佳答案
IIUC
#df.groupby(['id','lang']).text.apply(list).unstack(-2)
df.groupby(['id','lang']).text.apply(','.join).unstack(-2)
Out[384]:
id 1 2 3 4
lang
en text1,text3 text4 text5 text7
ru None None None text6
ua None text2 text8 None
如果你想成为“列表”(字典)
df.groupby(['id','lang']).text.apply(','.join).unstack(-2).T.fillna('').to_dict('l')
Out[386]:
{'en': ['text1,text3', 'text4', 'text5', 'text7'],
'ru': ['', '', '', 'text6'],
'ua': ['', 'text2', 'text8', '']}
对于 ID
df.groupby(['id','lang']).text.apply(','.join).unstack(-2).columns.tolist()
Out[388]: [1, 2, 3, 4]
关于python - 在 Pandas 中将列拆分为列表,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/49258671/
这个问题在这里已经有了答案: How to initialize var? (11 个答案) 关闭 8 年前。 我想给一个变量赋初值 null,并在下一个 if-else block 中赋值,但是编
我正在使用 TypeScript 3.8 编写 JS 和 TS 混合的代码。我写了以下行: export * as Easing from './easing'; 应该是 fair game在 Typ
我需要将 R 代码中的“/”更改为“\”。我有这样的事情: tmp <- paste(getwd(),"tmp.xls",sep="/") 所以我的 tmp是 c:/Study/tmp.xls 我希望
我有个问题。例如我有这个: id truth count 1 1 1 2 1 2 3 0 0 4 1 1 5 1 2 6 1
我正在尝试使用“IN”和“=”来查找一些 bean。我目前正在使用此代码: $ids = array(1,2,3,4); $user = 1; $things = R::find( 'thing'
是否可以在 Xcode 中部署到其他人的手机上?我没有 iPhone,但我想测试我在 friend 手机上制作的应用程序。在我支付 99 美元之前,我想确保这不会造成麻烦。 谢谢。 最佳答案 不会有任
我试图得到一个非常大的数字(超过 unsigned long long int )。所以我把它作为一个字符串,然后一个数字一个数字地转换成整数并使用它。 #include #include int
我在 Rust 中有 C 语言库的绑定(bind),但它们并不完整。 在 C 代码中,我定义了一个简化的宏,如下所示: #define MY_MACROS1(PTR) (((my_struct1
我正在努力解决这个问题。 http://jsfiddle.net/yhcqfy44/ 动画应该自动相对于 滚动到顶部每次出现滚动条时的高度。 我已经写了这个,但没有运气: var hheight =
我正在处理一个将数字作为字符串返回的 JSON API。例如 "12" ,但是,该字段值也可以是非数字的,例如:"-" . 我已将 JSON 数据解析为映射,我想将此字段提取为 elixir 中的整数
我正在尝试编写一个类,将.wav文件转换为.aiff文件作为项目的一部分。 我遇到了几个库Alvas.Audio(http://alvas.net/alvas.audio,overview.aspx)
我想在 Lucene 中将像“New York”这样的“复合词”索引为单个术语,而不是像“new”、“york”那样。这样,如果有人搜索“new place”,则包含“new york”的文档将不会匹
我希望这个解释能让我更好地了解使用宏的优点。 最佳答案 在函数中,所有参数在调用之前都会被评估。 这意味着 or 作为函数不能是惰性的,而宏可以将 or 重写为 if 语句,该语句仅在以下情况下计算分
我有一些看起来像这样的 XML foo ]]> (注意 > 登录 "> foo")和 XSLT 样式表 当我运行xsltproc stylesheet.xs
当我尝试将 Any 转换为 List 时,如下面的示例所示,我得到“Unchecked cast: Any!”到列表'警告。有没有解决此类问题的方法? val x: List = objectOfTy
我正在使用 Python 开发一个简单的爬虫。目的是创建一个 sitemap.xml。(你可以在这里找到真正的 alpha 版本:http://code.google.com/p/sitemappy/
我想知道在 VBScript 中是否可以在多行中中断 If 语句。喜欢: If (UCase(Trim(objSheet.Cells(i, a).Value)) = "YES") Or _ (UCas
for (String item : someList) { System.out.println(item); } 使用“do while”是否等效? 谢谢。 最佳答案 如果列表为空,f
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: Split string with delimiters in C 在 C 中将“,”分隔的列表拆分为数组的最佳方法
我有一个如下所示的字符数组: [0, 10, 20, 30, 670] 如何将此字符串转换为整数数组? 这是我的数组 int i=0; size_t dim = 1; char* array = (c
我是一名优秀的程序员,十分优秀!