python - 如何将具有字符串值(如 '[title:item][' title2 :item]'. ..etc)的列拆分为带有 pandas 的字典-6ren

python - 如何将具有字符串值(如 '[title:item][' title2 :item]'. ..etc)的列拆分为带有 pandas 的字典

转载作者：太空宇宙更新时间：2023-11-03 15:46:08

24

4

我正在尝试清理数据框中的一些数据。特别是显示如下的列:

0    [Bean status:Whole][Type of Roast:Medium][Coff...
1    [Type of Roast:Espresso][Coffee Type:Blend]
2    [Bean status:Whole][Type of Roast:Dark][Coffee...
3    [Bean status:Whole][Type of Roast:Light][Coffe...
4                                                  NaN
5    [Roaster:Little City][Type of Roast:Light][Cof...

Name: options, dtype: object

我的目标是将其分成四列并将相应的值分配给列，如下所示:

     Roaster    Bean Status    Type of Roast    Coffee Type
0    NaN        Whole          Medium           Blend
1    NaN        NaN            Espresso         Blend
..
5    Littl...   Whole          Light            Single Origin

我试过 df.str.split('[', expand=True) 但它不适合，因为选项并不总是存在或位于相同位置。

我的想法是尝试将字符串拆分成一个字典并将该字典存储在一个新的数据框中，然后将两个数据框连接在一起。但是，我在尝试将列存储到字典中时迷路了。我试过这样做:https://www.fir3net.com/Programming/Python/python-split-a-string-into-a-dictionary.html像这样:

roasts = {}
roasts = dict(x.split(':') for x in df['options'][0].split('[]'))
print(roasts)

我得到这个错误:

ValueError: dictionary update sequence element #0 has length 4; 2 is required

我尝试通过存储到列表来调查这里发生了什么:

s = ([x.split(':') for x in df['options'][0].split('[]')])
print(s)

[['[Bean status', 'Whole][Type of Roast', 'Medium][Coffee Type', 'Blend]']]

所以我看到代码没有按照我想要的方式拆分字符串，并且尝试将单个括号替换到那些不同的位置，但没有得到正确的结果。

是否可以将此列放入字典中，还是我必须求助于正则表达式？

最佳答案

使用 AmiTavory 的示例数据

df = pd.DataFrame(dict(options=[
    '[Bean status:Whole][Type of Roast:Medium]', 
    '[Type of Roast:Espresso][Coffee Type:Blend]'
]))

`re.findall` 和`str.split` 的结合

import re
import pandas as pd

pd.DataFrame([
    dict(
        x.split(':')
        for x in re.findall('\[(.*?)\]', v)
    )
    for v in df.options
])

  Bean status Coffee Type Type of Roast
0       Whole         NaN        Medium
1         NaN       Blend      Espresso

关于python - 如何将具有字符串值(如 '[title:item][' title2 :item]'. ..etc)的列拆分为带有 pandas 的字典，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49848978/

24

4

0

文章推荐： php - php脚本是如何执行的

文章推荐： python - 对数据框的 SQL 查询

文章推荐： c# - 如何防止编辑url地址？

文章推荐：具有多个接收者的 PayPal 设置

java - Arraylist 分为 -
我有一个数组列表: ArrayList allText = new ArrayList(); 其内容是这样的: [Alabama - Montgomery, Alaska - Juneau, Ariz
php - 开始和结束时间，分为 1 小时段
我有一个 timestamp 格式的开始和结束时间。我想将它们分成多个时间段，例如 1 小时。 $t1 = strtotime('2010-05-06 12:00:00'); $t2 = strtot
css - span10 分为 3 列
我需要将 span10 分成 3 列，但我无法将它们排列起来。我应该在 span10 中添加一个 span12 还是使用 offset 还是？？
Pandas - 分为 24 小时区 block ，但不是午夜到午夜
我有一个时间序列。我想从早上 8 点到第二天早上 7:59 分成 24 小时的区 block 。我知道如何按日期分组，但我尝试过使用 TimeGroupers 和 DateOffsets 处理这个 8
java - Android Java 分为 4 个整数
我收到“街道号码邮政编码城市”形式的地址(作为字符串)。我想要做的是将街道和号码与邮政编码和城市分开。通常你可以按空格分割。但有些街道名称中也有空格，例如:“Emile Van Ermengemlaa
java - 将 JList 分为 2 组的优化方法
我有一个用户列表。其中一些用户处于第一状态，而其他用户处于第二状态。所以我想要的是将这个列表显示为首先，它按排序顺序显示存在 = 1 的用户，然后按排序顺序显示存在 = 2 的用户。这里的排序是根据用
javascript - 将 div 分为 3 列
我感觉我搜索了整个网络，但找不到一种方法将不同高度的 div 很好地划分为 3 列，就像 http://www.ing.nl 上那样 headertekst headerteksttesth
css - td 内的 Bootstrap 按钮下拉菜单，分为 2 行
Bootstrap 3 按钮下拉菜单出现问题。你可以在这里看到我的两个例子: http://www.bootply.com/W1dLusilMk http://www.bootply.com/GGBv
javascript - 返回的 php JSON 分为 2 个 Javascript 对象
我在 php 中执行以下操作 foreach($QuestionAsekd as $k => $v){ $grp_name = $v['NAME']; $groupValues[$gr
python - Pandas DataFrame [cell=(label,value)]，分为 2 个独立的数据框
我找到了一种用pandas解析html的绝妙方法。我的数据格式有点奇怪(见下文)。我想将这些数据拆分为 2 个单独的数据帧。注意每个单元格如何由，分隔...是否有任何真正有效的方法来分割所有这些单元
html - CSS
分为 2 列。没有

首页

博学

6Ren·AI

商城