python - 如何计算数据框行中单词列表的出现次数总和？-6ren

python - 如何计算数据框行中单词列表的出现次数总和？

转载作者：太空宇宙更新时间：2023-11-03 20:48:51

25

4

我想计算列表中每行给定数据框列中单词的出现次数。

代码:

 d2 = {}
 for key, lst in dict_.items():
    col_names = [element for element in lst if isinstance(element, str)]
    regex_lists = [element for element in lst if isinstance(element, list)]
    regex_list = functools.reduce(lambda x, y: x+y, regex_lists)
    map_function = lambda s: len(re.findall(r'|'.join(regex_list).lower(),  str(s).lower()))
   df_regex_count = df[col_names].applymap(map_function)
   df[key] = [sum(lst_tmp) for lst_tmp in    df_regex_count.values.tolist()]

我的数据框是:

 d = {'Column_1': ['mango juice pret Orange No manner  Emman snow', ' préts No  scan eblanc'],}
 df = pd.DataFrame(data=d)

我的单词列表

list_1 = ['mango juice', 'Mango' ,'Orange', 'pr[éeêè]t[s]?']
dict = {"s1": ['Column_1', list_1]}

s1的输出是[3,1]，但它必须是[4,1]。因为“芒果汁”，芒果，橙子，漂亮

dictionary

创建 csv 文件列表。

df['Word'] = r'\b' + df[' Word'].astype(str) + r'\b'
df.groupby('Country').agg(",".join).reset_index()
group1 =df[df['Country']== 1]
list1.append("|".join(group1['Word']))

最佳答案

re.findall返回字符串中模式的所有非重叠匹配。
这意味着在模式中搜索匹配项时会消耗该字符串。因此，如果匹配的子字符串本身就是匹配，则会丢失。

这就是您的情况下 'mango' 和 'mango Juice' 所发生的情况，因为您的正则表达式组合了所有要与 or 匹配的字符串.

如果您想查找重叠的情况，请勿将要搜索的单词与正则表达式中的 | 组合起来，而是对每个单词执行搜索。

def map_function(s, reglst):
    matches = [len(re.findall(rg.lower(), s.lower())) for rg in reglst]
    return sum(matches)

在这里我重新定义了您的map_function。它使用列表理解对 regex_list 的每个单词执行一次 re.findall 并返回所有出现次数的总和。

那么你的代码将是:

for key, lst in dict_.items():
    col_names = [element for element in lst if isinstance(element, str)]
    regex_lists = [element for element in lst if isinstance(element, list)]
    regex_list = functools.reduce(lambda x, y: x+y, regex_lists)
    df_regex_count = df[col_names].applymap(lambda s : map_function(s, regex_list))
    df[key] = [sum(lst_tmp) for lst_tmp in df_regex_count.values.tolist()]

现在df s:

                                        Column_1  s1
0  mango juice pret Orange No manner  Emman snow   4
1                          préts No  scan eblanc   1

编辑

您需要您的正则表达式列表list1类似于:

list1 = [r'\bmango juice\b', r'\bMango\b' ,r'\bOrange\b', r'\bpr[éeêè]t[s]?\b']

这是一个列表，每个元素一个单词。查看您的代码，您可能可以通过以下方式创建它:

df['Word'] = r'\b' + df[' Word'].astype(str) + r'\b'
df.groupby('Country').agg(",".join).reset_index()
group1 =df[df['Country']== 1]
list1.extend(group1['Word'])

关于python - 如何计算数据框行中单词列表的出现次数总和？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/56398069/

25

4

0

文章推荐： c# - 将查询结果存储到变量中

文章推荐： html - CSS - 分区高度

文章推荐： opencv - 如何实现更好的滑动窗口算法？

文章推荐： c# - 如何在C#中设置下载超时

mysql - Action 次数
你好，我有一张 table : from | to | item | count ------- Jack | Danie| food | 10 Danie| Maria| food | 2 Ja
java - 计算单元测试运行期间发生的 gc 次数
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。这个问题似乎偏离主题，因为它缺乏足够的信息来诊断问题。更详细地描述您的问题或 include a mini
java - 如何计算可能的最大 session 次数
我正在尝试解决以下面试问题 Given two arrays firstDay and lastDay representing the intervals in days of possible m
c - 这段代码中调用了 fork() 次数？
这个问题已经有答案了: Explanation of a output of a C program involving fork() (2 个回答) 已关闭 9 年前。这是我从我的研究所去年的试卷
javascript - 重复一个 div 次数
如何在 html 页面上重复一个 div X 次，可以说我想设置方差来声明重复次数。重复这个部分 5 次，我假设它是用 JS 的。 black BLUE WHITE strip 我
php - 计算成功执行PDO php的execute()次数
我目前使用类中的函数将数据插入数据库，如果每行成功插入(从 csv 文件)，则会记录一条消息(logMessage 函数)，以显示哪一行成功或失败。但是我想要已导入数据库的成功执行的计数。我遇到了一些
for-loop - 如何循环特定(可变)次数？
这个问题可能看起来非常基础，但我很难弄清楚如何做。我有一个整数，我需要使用 for 循环来循环整数次。首先，我尝试了—— fn main() { let number = 10; // An
algorithm - 确定合并排序的调用(激活)次数
我正在准备 CS 125 期末考试，其中(简要地)介绍了 Big O Notation。鉴于: Mergesort 的最佳运行时间为 O(N lg(N))，最坏运行时间为 O(N lg (N)) 有
java - 我们可以举行的最大 session 次数
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 3 年前。 Improve this qu
c - 骰子实验，增加最大 throw 次数
我正在构建一个简单的程序来计算骰子实验中数字的频率，但我尝试扩展它并将最大 throw 次数增加到巨大的数字，通过反复试验，我发现最大限制为519253。使用这个最大值，我也无法创建任何新数组，它会
algorithm - 优化:最小化 session 次数
这是一道面试题 There is an airline company that wants to provide new updates to all of its flight attendant
Excel VBA 自动化 - 根据单元格值复制行 "x"次数
我正在尝试以一种可以节省我无数小时的繁琐数据输入的方式实现 Excel 自动化。这是我的问题。我们需要为所有库存打印条形码，其中包括 4,000 种型号，每种型号都有特定数量。 Shopify是我们
javascript - 优化 ng-repeat 次数 |angularJS
我想根据给定的预定义级别(从级别 1 到级别 6)分离代码中的所有内容，现在我的 JSON 读取 $scope.myJson=[{ id: 1, level: 1, name: "any
javascript - 在悬停时限制 jquery 执行(次数/时间)
我创建了一个菜单，它使用一些 CSS 和 jquery 在悬停时显示其子菜单。事情是，如果用户在菜单项上多次悬停，它会有点滑稽。这是网址:http://91.202.168.37/~ibi/ ，这是
python - 使用 pandas 一周中每天的平均 Action 次数
假设我对每小时的事件数进行了如下统计: np.random.seed(42) idx = pd.date_range('2017-01-01', '2017-01-14', freq='1H') df
hadoop - 在 Hadoop 中读取文件时的 seeks() 次数？
我想确保我正确理解了这个概念: 在 Hadoop 权威指南中指出:“设计文件系统的目标始终是减少与要传输的数据量相比的查找次数。”在此声明中，作者指的是 Hadoop 逻辑 block 的“seeks
c++ - 计算 std::vector 的复制和 move 次数
我有一个用 C++11 编写的程序，我想计算 std::vector 的 move 和复制(构造和赋值)次数。对象。有办法吗？最好的问候最佳答案否。 std::vector<>的执行没有办法做到
git - 有什么方法可以查看在 github 上访问/下载 repo 的最后/次数？
我们组织的帐户空间不足，我们一直在尝试剔除一些较旧的存储库。问题在于一些较旧的存储库可能仍然是事件服务的依赖项(即使它们多年未更新)。我知道我们可以跟踪克隆，但据我所知，我们看不到直接下载/pull

首页

博学

6Ren·AI

商城

python - 如何计算数据框行中单词列表的出现次数总和？

编辑