python - 使用函数和 for 循环将文本与多个文件的列表进行比较-6ren

python - 使用函数和 for 循环将文本与多个文件的列表进行比较

转载作者：行者123 更新时间：2023-12-01 08:24:13

25

4

我的最终目标是创建一个遍历多个文件的 for 循环，以及一个将术语索引与数据帧进行比较的附加 for 循环。为了使这更有趣，我还包含了一个函数，因为我可能必须将相同的原理应用于同一数据框中的另一个变量。有一些问题。

我不确定在这种情况下是否应该使用正则表达式，或者简单的 in 语句是否足够。
我使用的方法效率不高(更不用说它不起作用)。我希望有类似 isin 语句的东西，但是列表中的每个单词都需要根据数据帧的一行进行检查。但是，当我尝试做这样的事情时，我不确定如何应用它......

df:    
     'headline'                                                'source'
     targets is making better stars in the bucks               target news
     more diamonds than rocks in saturn rings                  wishful thinking
     diamond in the rough employees take too many naps         refresh sleep

data:
      'company'
      targets 
      stars in the bucks
      wallymarty
      velocity global
      diamond in the rough

ccompanies = data['company'].tolist() #convert into list 
def find(x): #function to compare df['headline'] against list of companies
    result = []
    companies = set(ccompanies) #edit based on comment, saves time
    for i in companies:
        if i in x:
            result.append(x)
    return result

matches = df['headline'].apply(find)

所需的输出将是与公司匹配的标题列表: 目标是在雄鹿队培养更好的球星未加工的钻石员工小睡太多

编辑:我的脚本已被编辑，现在它可以运行并显示标题。但是，输出不仅显示所需的输出，还显示数据帧的所有行，并且仅填充了适用的行。

最佳答案

... should be using regex in this case or if a simple in statement is sufficient?

使用 in 就可以了，因为您显然已经标准化为 .lower() 并删除了标点符号。

您确实应该尝试使用更有意义的标识符。例如，通常的习语不是i，而是for company in Companies:。

您已经了解了如何使用 .tolist()，这很好。但您确实希望创建一个 set 而不是 list，以支持高效的 in 测试。这是 O(1) 散列查找与列表线性扫描的嵌套循环之间的区别。

这没有什么意义:

        for i in ccompanies:
            i = [x]

你开始迭代，但随后i本质上变成了一个常量？目前还不清楚你要做什么。

如果您进一步推进该项目，您可能会考虑将公司与 NLTK 进行匹配或来自 scikit-learn 的 TfidfVectorizer，或https://pypi.org/project/fuzzywuzzy/

关于python - 使用函数和 for 循环将文本与多个文件的列表进行比较，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/54391757/

25

4

0

文章推荐： python - 使用pip安装mujoco库时出错

文章推荐： jquery - SlideDown 对我不起作用

文章推荐： python - PySerial readline() 首先返回命令，然后返回答案

Python 这段代码做了什么？列表=列表[列表!=值]
如标题所示，ans_list是一个答案列表，ans_index是一个数字(答案在词汇表中的索引，但与atm无关) 这里生成的 tree.anslist 是什么？ (例如，仅针对第一个)，忽略迭代。 f
MySQL 列表 IN 列表
我目前将用户的输入存储在逗号分隔的列表中，如下所示: Userid | Options 1 | 1,2,5 用户在一个数组形式中勾选一组选项，然后用逗号连接起来 1,2,5 然后 MySQ
MySQL 列表 IN 列表
我目前将用户的输入存储在逗号分隔的列表中，如下所示: Userid | Options 1 | 1,2,5 用户在一个数组形式中勾选一组选项，然后用逗号连接起来 1,2,5 然后 MySQ
list - 我怎样才能完全展平一个列表(列表(列表)......)
我想知道如何完全展平列表和包含它们的东西。除其他外，我想出了一个解决方案，它可以将具有多个元素的东西滑倒并将它们放回原处，或者在滑倒后将具有一个元素的东西拿走。这与 How do I “flatte
list - 我怎样才能完全展平一个列表(列表(列表)......)
我想知道如何完全展平列表和包含它们的东西。除其他外，我想出了一个解决方案，它可以将具有多个元素的东西滑倒并将它们放回原处，或者在滑倒后将带有一个元素的东西拿走。这与 How do I “flatte
java - 列表<列表<字符串>>到字符串[][]
这个问题已经有答案了: Convert nested list to 2d array (3 个回答) 已关闭 7 年前。 java中有没有快捷方式可以转换 List> 到 String[][] ？
java - 列表<列表<对象>>排序
我在排序时遇到问题 List> 。我创建了一个自定义比较器，在其中编写了对数据进行排序的代码。 public class CustomComparator implements Comparator
java - 列表数组列表转换
这个问题已经有答案了: 已关闭10 年前。 Possible Duplicate: Java Generics: Cannot cast List to List? 我只是想知道为什么下面的java代
c# - 列表<逗号分隔的字符串> => 列表<字符串>?
试图想出一个 LINQy 方法来做到这一点，但我什么也没想到。我有一个对象列表<>，其中包含一个属性，该属性是逗号分隔的字母代码列表: lst[0].codes = "AA,BB,DD" lst[1
python - 列表 += 元组与列表 = 列表 + 元组
假设我有这些任务: points = [] point = (1, 2) 我怎么会这样做: points += point 它工作得很好，并且给了我点 = [1, 2]。但是，如果我这样做: poin
scala - 将列表[任务[列表[A]]]转换为任务[列表[A]]
如何在 scala 中将 List[Task[List[Header]]] 类型转换为 Task[List[Header]]。我有一个方法返回 Task[List[Header]] 并多次调用 do
java - 如何在Java中获取二维列表的元素？例如，列表<列表<整数>>
如何在 Java 中查找二维列表的元素？我有一个参数为 List> 的函数我想知道如何找到这个列表的行和列。最佳答案如果你喜欢 List> obj 然后你就可以像这样访问 obj.get(cur
java - 列表<列表没有按预期工作
分配 List到 List工作正常。分配 List>到 List>不编译。代码 public class Main { public static void main(String[] a
java - 列表<可序列化> vs 列表
我正在用 Java 编写一个方法，该方法必须接收并迭代 Serializable 的 List。有什么区别: public void myMethod(List list) { } 和 public
java - 通知网格/列表/树内网格/列表/树的更改
我看到很多人想用 mvvm 更新网格/列表/树的一部分，但他们不想刷新整个列表。对于所有遇到此问题的人，我做了以下示例。希望这对你有用。最佳答案这是一个简单的例子。整个代码中最重要的是: Bi
C++ 列表到 Python 列表
我正在为现有的 C++ 库编写包装器，该库使用列表，其中 T 是自定义结构。我被建议使用 vector 而不是列表，但我试图避免修改库。为了更好地理解这个场景，我做了一个简单的应用程序，使用一个列表
java - 列表 VS 列表<基础>
List list List list 这两种声明有什么区别吗？谢谢，最佳答案是的。 List可以包含所有派生自 Base 的不同事物的混合物. List包含同质项(从某种意义上说，它们必须全部
Java 泛型 : List, 列表<对象>、列表
有人可以尽可能详细地解释以下类型之间的区别吗？ List List List 让我更具体一点。我什么时候想使用 // 1 public void CanYouGiveMeAnAnswer(List l
python - 是否有任何 python 模块可以计算(列表，列表)元组的频率？
我有一个元组列表，每个元组都是一对列表。所以我的数据看起来像: mylist = [(['foo', 'bar'], ['bar', 'bar']),(['bar', 'bar'],['bar', '
list - 给定一个 (a * b) 列表，返回一个 (a * b list) 列表
也许是一个时髦的标题，但我遇到了以下问题: 给定一个类型为 (a * b) list 的列表，我想创建一个类型为 (a * b list) list 的新列表。一个例子: 给定列表 let testL

首页

博学

6Ren·AI

商城

python - 使用函数和 for 循环将文本与多个文件的列表进行比较