- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
在下面的示例中,我能够将包含文本数据的 pandas 列与多个字符串集合进行匹配。输出只会告诉我 df.col1
单元格的任何部分是否包含集合中的元素之一。它不会告诉我是哪一个!我有兴趣得到准确的结果(字符串匹配或更好的是它在集合数组中的位置)
words = ['dog', 'monkey']
pat = "|".join(map(re.escape, words))
df = pd.DataFrame({'col1':['lion bites dog','dog bites monkey','monkey bites man','man bites apple']})
df.loc[df.col1.str.contains(pat),'col1']
我需要知道集合中的哪个字符串(上面的单词)匹配的原因是因为集合中的每个元素都可以映射到一个数值。喜欢
words_dict = {'dog':'1', 'monkey':'2'}
我或许可以尝试df.map(dict)
但在实际情况下,集合存储在pandas dataframe
words_df = pd.DataFrame({1:['dog'], 2:['monkey']})
我可以想到一个相当迂回的解决方案,即迭代检查集合中的每个元素,但如果集合中的元素数量很大,这似乎效率很低。
编辑//
所需的输出可以是:
[0,0,1,NaN] or ['dog','dog','monkey',False]
最佳答案
概念 1
使用集合
s = df.col1.str.split().apply(set)
s - (s - set(words))
0 {dog}
1 {monkey, dog}
2 {monkey}
3 {}
Name: col1, dtype: object
概念 2
使用 str.get_dummies
df.col1.str.get_dummies(sep=' ')[words]
dog monkey
0 1 0
1 1 1
2 0 1
3 0 0
拉伸(stretch)这个以获得想要的结果
d1 = df.col1.str.get_dummies(sep=' ')
d2 = d1.loc[:, d1.columns.intersection(words)]
d2[d2.any(1)].idxmax(1).reindex(d2.index)
0 dog
1 dog
2 monkey
3 NaN
dtype: object
概念 3
使用 numpy
s = df.col1.str.split(expand=True).stack()
a = s.values[:, None] == [words]
pd.Series(np.where(a.any(1), a.argmax(1), np.nan), s.index).groupby(level=0).min()
0 0.0
1 0.0
2 1.0
3 NaN
dtype: float64
关于python - pandas str.contains 匹配多个字符串并获取匹配的值,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/42867311/
你信吗?我有一个这样的循环(请原谅任何错误,我不得不大量编辑大量信息和变量名称,相信我它有效)。 ...旧示例已删除,请参见下面的代码... 如果我将那些中间的 str = "Blah\(odat.c
我正在做一个本地测试来比较 C# 中 String 和 StringBuilder 的 Replace 操作性能,但是对于 String 我使用了以下代码: String str = "String
我想知道为什么str += "A"和 str = str + "A"有不同的表现。 在实践中, string str = "cool" for(int i = 0; i approximately
我有一个类型列表 [("['106.52.116.101']", 1), ("['45.136.108.85']", 1)] 并想将其转换为 [('106.52.116.101', 1), ('45.
我有一个类型列表 [("['106.52.116.101']", 1), ("['45.136.108.85']", 1)] 并想将其转换为 [('106.52.116.101', 1), ('45.
我正在遍历 HashMap并通过一些本地变量中的模式匹配将值放入其中。 委托(delegate)者 fn lyrics_no_bottles(song_template:&mut String){
如果字符串(短语)中只有元音,它(对我而言)说True;否则说 False。我不明白为什么它总是返回 False,因为 (x >= x) 总是返回 True。我感谢任何人检查此查询的解决方案。 (st
我有代码以某种方式转换字符串引用,例如取第一个字母 trait Tr { fn trim_indent(self) -> Self; } impl Tr for &'a str { f
我正在学习指针,这是我的代码。我定义了一个指向 char(实际上是字符串)的指针 *str 和一个指向 int *a 的指针,它们的定义方式相同。我认为 str 和 a 都应该是一个地址,但是当我试图
为什么我会收到错误消息?我已经正确添加了类型,对吗? Invalid index type "str" for "Union[str, Dict[str, str]]"; expected type
你知道下面两个函数是否等价吗? function validate(str) { return ( ['null','','undefined'].indexOf(str) [v, valida
我正在解决这里的 Dataquest 问题:https://app.dataquest.io/m/293/data-cleaning-basics/5/removing-non-digit-chara
我有一个字符串列表,如下所示: ["A TB", "A-R TB", "B TB", "B-R TB", "C TB", "C-R TB"...] 但字符串的顺序是随机的。我如何编写一个将元素配对的函
我正在尝试将此函数从使用 split 改为使用 str.extract (正则表达式)。 def bull_lev(x): spl = x.rsplit(None, 2)[-2].strip(
给定这样的数据结构: [{'a':1, 'b': 2}, {'c':3 }, {'a':4, 'c':9}, {'d':0}, {'d': 0, 'b':6}] 目标是解析数据以产生: {'a': 2
给定这样的数据结构: [{'a':1, 'b': 2}, {'c':3 }, {'a':4, 'c':9}, {'d':0}, {'d': 0, 'b':6}] 目标是解析数据以产生: {'a': 2
s = 'someString' s = QTreeWidgetItem(s) print(s.text(0)) # 0 being 'column' 输出: 's' 如果我对另一
黑白有什么区别: function(char* str ) function(char* str[] ) function(char str[] ) 它们是如何被调用的(通过什么类型的string/c
我试过谷歌搜索但找不到准确的答案,所以请允许我尝试在这里提问。如果问题看起来不合适,请告诉我,我会删除它。 在 JS 中,您可以通过三种不同的方式编写特定的内置功能: 字符串长度 str.toStri
我有这段代码(我的 strlen 函数) size_t slen(const char *str) { size_t len = 0; while (*str) {
我是一名优秀的程序员,十分优秀!