- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我有一个约 700 个键的默认字典。 key 采用 A_B_STRING 等格式。我需要做的是用“_”拆分 key ,如果 A 和 B 相同,则比较每个 key 的“STRING”之间的距离。如果距离 <= 2,我想将这些键的列表分组到一个 defaultdict key:value 组中。将有多个键应该匹配并分组。我还想保留在新的组合 defaultdict 中,所有没有进入组的键:值对。
输入文件在FASTA格式,其中标题是键,值是序列(使用 defaultdict 是因为基于原始 fasta 文件的 blast 报告,多个序列具有相同的标题)。
这是我目前所拥有的:
!/usr/bin/env python
import sys
from collections import defaultdict
import itertools
inp = sys.argv[1] # input fasta file; format '>header'\n'sequence'
with open(inp, 'r') as f:
h = []
s = []
for line in f:
if line.startswith(">"):
h.append(line.strip().split('>')[1]) # append headers to list
else:
s.append(line.strip()) # append sequences to list
seqs = dict(zip(h,s)) # create dictionary of headers:sequence
print 'Total Sequences: ' + str(len(seqs)) # Numb. total sequences in input file
groups = defaultdict(list)
for i in seqs:
groups['_'.join(i.split('_')[1:])].append(seqs[i]) # Create defaultdict with sequences in lists with identical headers
def hamming(str1, str2):
""" Simple hamming distance calculator """
if len(str1) == len(str2):
diffs = 0
for ch1, ch2 in zip(str1,str2):
if ch1 != ch2:
diffs += 1
return diff
keys = [x for x in groups]
combos = list(itertools.combinations(keys,2)) # Create tupled list with all comparison combinations
combined = defaultdict(list) # Defaultdict in which to place groups
for i in combos: # Combo = (A1_B1_STRING2, A2_B2_STRING2)
a1 = i[0].split('_')[0]
a2 = i[1].split('_')[0]
b1 = i[0].split('_')[1] # Get A's, B's, C's
b2 = i[1].split('_')[1]
c1 = i[0].split('_')[2]
c2 = i[1].split('_')[2]
if a1 == a2 and b1 == b2: # If A1 is equal to A2 and B1 is equal to B2
d = hamming(c1, c2) # Get distance of STRING1 vs STRING2
if d <= 2: # If distance is less than or equal to 2
combined[i[0]].append(groups[i[0]] + groups[i[1]]) # Add to defaultdict by combo 1 key
print len(combined)
for c in sorted(combined):
print c, '\t', len(combined[c])
问题是这段代码没有按预期工作。在组合的 defaultdict 中打印键时;我清楚地看到有很多可以组合的。但是,合并后的 defaultdict 的长度大约是原始长度的一半。
编辑
替代方案没有 itertools.combinations:
for a in keys:
tocombine = []
tocombine.append(a)
tocheck = [x for x in keys if x != a]
for b in tocheck:
i = (a,b) # Combo = (A1_B1_STRING2, A2_B2_STRING2)
a1 = i[0].split('_')[0]
a2 = i[1].split('_')[0]
b1 = i[0].split('_')[1] # Get A's, B's, C's
b2 = i[1].split('_')[1]
c1 = i[0].split('_')[2]
c2 = i[1].split('_')[2]
if a1 == a2 and b1 == b2: # If A1 is equal to A2 and B1 is equal to B2
if len(c1) == len(c2): # If length of STRING1 is equal to STRING2
d = hamming(c1, c2) # Get distance of STRING1 vs STRING2
if d <= 2:
tocombine.append(b)
for n in range(len(tocombine[1:])):
keys.remove(tocombine[n])
combined[tocombine[0]].append(groups[tocombine[n]])
final = defaultdict(list)
for i in combined:
final[i] = list(itertools.chain.from_iterable(combined[i]))
但是,使用这些方法,我仍然遗漏了一些与其他方法不匹配的内容。
最佳答案
考虑到这种情况,我想我发现您的代码存在一个问题:
0: A_B_DATA1
1: A_B_DATA2
2: A_B_DATA3
All the valid comparisons are:
0 -> 1 * Combines under key 'A_B_DATA1'
0 -> 2 * Combines under key 'A_B_DATA1'
1 -> 2 * Combines under key 'A_B_DATA2' **opps
我想您会希望将所有这三个组合在一个键下。但是请考虑这种情况:
0: A_B_DATA111
1: A_B_DATA122
2: A_B_DATA223
All the valid comparisons are:
0 -> 1 * Combines under key 'A_B_DATA111'
0 -> 2 * Combines under key 'A_B_DATA111'
1 -> 2 * Combines under key 'A_B_DATA122'
现在它变得有点棘手,因为第 0 行与第 1 行的距离为 2,第 1 行与第 2 行的距离为 2,但您可能不希望它们都放在一起,因为第 0 行与第 2 行的距离为 3!
这是一个可行的解决方案示例,假设这是您希望输出的样子:
def unpack_key(key):
data = key.split('_')
return '_'.join(data[:2]), '_'.join(data[2:])
combined = defaultdict(list)
for key1 in groups:
combined[key1] = []
key1_ab, key1_string = unpack_key(key1)
for key2 in groups:
if key1 != key2:
key2_ab, key2_string = unpack_key(key2)
if key1_ab == key2_ab and len(key1_string) == len(key2_string):
if hamming(key1_string, key2_string) <= 2:
combined[key1].append(key2)
在我们的第二个示例中,这将产生以下字典,如果这不是您要查找的答案,您能否准确输入此示例的最终字典应该是什么?
A_B_DATA111: ['A_B_DATA122']
A_B_DATA122: ['A_B_DATA111', 'A_B_DATA223']
A_B_DATA223: ['A_B_DATA122']
请记住,这是一个复杂度为 O(n^2) 的算法,这意味着当您的 key 集变大时它不可扩展。
关于Python - 通过键中的汉明距离对 defaultdict 值进行分组,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/37752332/
您好,我正在处理 BIRT 报告。我有一个查询,我必须对父级的重复数据进行分组,但子级也不能分组! 在我的查询中: item 是父项,item_ledger_entry 是子项。我有来自 item.N
我正在使用 GA API。 这是针对 MCF 目标报告(底部)的标准目标完成指标表(顶部) 看一下这个: 总数加起来 (12,238),但看看按 channel 分组的分割有多么不同!我以为这些会很接
我正在开发一个流量计数器,我想获得 IP 和重复计数,但是如何? 就像是 :select ip, count(ip) from Redirect 返回 : null total ip count 重定
我尝试编写一个正则表达式来匹配条件表达式,例如: a!=2 1+2=2+a 我尝试提取运算符。我当前的正则表达式是“.+([!=<>]+).+” 但问题是匹配器总是尝试匹配组中可能的最短字符串
在 MS Transact SQL 中,假设我有一个这样的表(订单): Order Date Order Total Customer # 09/30/2008 8
我想按 m.ID 分组,并对每个 m.id 求和 (pm.amount_construction* prod.anzahl) 实际上我有以下结果: Meterial_id | amount_const
我想根据多列中的值对值进行分组。这是一个例子: 我想得到输出: {{-30,-50,20},{-20,30,60},{-30,NULL or other value, 20}} 我设法到达: SELE
我正在尝试找出运行此查询的最佳方式。我基本上需要返回在我们的系统中只下了一个订单的客户的“登录”字段列表(登录字段基本上是客户 ID/ key )。 我们系统的一些背景...... 客户在同一日期下的
给定以下mysql结果集: id code name importance '1234', 'ID-CS-B', 'Chocolate Sauce'
大家好,我的数据框中有以下列: LC_REF 1 DT 16 2C 2 DT 16 2C 3 DT 16 2C 1 DT 16 3C 6 DT 16 3C 3
我有这样的 mongoDB 集合 { "_id" : "EkKTRrpH4FY9AuRLj", "stage" : 10, }, { "_id" : "EkKTRrpH4FY9
假设我有一组数据对,其中 index 0 是值,index 1 是类型: input = [ ('11013331', 'KAT'), ('9085267',
java中用stream进行去重,排序,分组 一、distinct 1. 八大基本数据类型 List collect = ListUtil.of(1, 2, 3, 1, 2).stream().fil
基本上,我从 TABLE_A 中的这个开始 France - 100 France - 200 France - 300 Mexico - 50 Mexico - 50 Mexico - 56 Pol
我希望这个正则表达式 ([A-Z]+)$ 将选择此示例中的最后一次出现: AB.012.00.022ABC-1 AB.013.00.022AB-1 AB.014.00.022ABAB-1 但我没有匹配
我创建了一个数据透视表,但数据没有组合在一起。 任何人都可以帮助我获得所需的格式吗? 我为获取数据透视表而编写的查询: DECLARE @cols AS NVARCHAR(MAX), -- f
我想按时间段(月,周,日,小时,...)选择计数和分组。例如,我想选择行数并将它们按 24 小时分组。 我的表创建如下。日期是时间戳。 CREATE TABLE MSG ( MSG_ID dec
在 SQL Server 2005 中,我有一个包含如下数据的表: WTN------------Date 555-111-1212 2009-01-01 555-111-1212 2009-
题 假设我有 k 个标量列,如果它们沿着每列彼此在一定距离内,我想对它们进行分组。 假设简单 k 是 2 并且它们是我唯一的列。 pd.DataFrame(list(zip(sorted(choice
问题 在以下数据框中 df : import random import pandas as pd random.seed(999) sz = 50 qty = {'one': 1, 'two': 2
我是一名优秀的程序员,十分优秀!