- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有一个基因组位置 ID 的遗传数据集,其中 2 个 ID 可以在一列中具有共享值。我希望创建另一个列来标识那些具有共享信息的人。
例如我的数据看起来像:
CP Shared_CP
1:10 1:10, 1:11, 1:12
1:20 1:56
1:11 1:11, 1:10, 1:12
1:22 1:21, 1:30
1:30 1:30, 1:21
我希望用匹配的
Shared_CP
标记行信息并唯一标识每个分组,输出:
CP Shared_CP matches
1:10 1:10, 1:11, 1:12 1
1:20 1:56 NA
1:11 1:11, 1:10, 1:12 1
1:22 1:21, 1:30 2
1:30 1:30, 1:21 2
我看到根据其他列的信息创建新列也有类似的问题,但我还没有找到一种方法来使它们解决我的问题,目前我一直在尝试使用基于共享信息的行标记如果他们在
Shared_CP
中有逗号列,但我不知道如何为单个匹配项提供一个唯一标识符来存储 - 任何帮助将不胜感激。
structure(list(CP = c("1:10", "1:20", "1:11", "1:22", "1:30"
), Shared_CP = c("1:10, 1:11, 1:12", "1:56", "1:11, 1:10, 1:12", "1:21, 1:30",
"1:30, 1:21")), row.names = c(NA, -5L), class = c("data.table",
"data.frame"))
编辑:对于额外的细节,我的实际数据集可以有多个 Shared_CP ID,而不仅仅是 2。在一行中也可以有多个 Shared_CP 输入,其中 CP 不相同/包含在 Shared_CPs 列中,我已将示例更改为反射(reflect)这一点。
最佳答案
如果我理解正确,OP想要
Shared_CP
创建唯一的组号无论基因组位置在 Shared_CP
中出现的顺序如何.所以,1:10, 1:11, 1:12
, 1:11, 1:10, 1:12
, 和 1:12, 1:11, 1:10
都是等价的。 Shared_CP
中只包含一个元素它应该被分配组号 NA
. CP
无关紧要。 data.table
的一种可能答案是
library(data.table)
library(magrittr)
DT[, tmp := strsplit(Shared_CP, ", ") %>% unlist() %>% sort() %>% toString(),
by = seq(nrow(DT))][
order(tmp) & tmp %like% ", ", matches := rleid(tmp)][
, tmp := NULL][]
CP Shared_CP matches
1: 1:10 1:10, 1:11, 1:12 1
2: 1:20 1:56 NA
3: 1:11 1:11, 1:10, 1:12 1
4: 1:22 1:21, 1:30 2
5: 1:30 1:30, 1:21 2
matches
第 2 组。
Shared_CP
被分成几部分,被强制转换为字符基因组位置向量,这些位置被排序并再次组合为字符键。此键存储在临时列
tmp
中. Shared_CP ID 号
matches
是通过应用
rleid()
创建的
tmp
的订购版本上的功能,从而跳过
tmp
的行不包括
", "
,即,其中
Shared_CP
仅由一个元素组成。最后,
tmp
已移除。
magrittr
)和链接(来自
data.table
)用于提高可读性。
关于r - 如何在另一列中创建数据标记信息列,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/62677507/
03-25 05:52:15.329 8029-8042/com.mgh.radio W/MediaPlayerNative: info/warning (703, 0) 03-25 05:52:15
我一直在 Internet 上到处寻找关于 FrameworkElementFactory 类的适当文档,但我似乎找不到有关它的适当教程或有用信息。 请问对这个问题了解更多的人可以给我更多的信息吗?这
我需要知道一个线程在进入等待状态之前如何将其ID发送到另一个线程。我想传递一个带有其ID的变量,但我不知道该怎么做。 最佳答案 如果只有一个线程及其父线程,则可以使用全局变量,因为它们在所有线程之间共
我正在尝试制作一个程序,该程序可以读取命令行上的所有单词,然后将其打印在新行上,而我想要做的是这样的: Some text: hello 但是相反,我得到了这样的东西: Some text: Hell
我有一个连接到rabbitmq服务器的python程序。当该程序启动时,它连接良好。但是当rabbitmq服务器重新启动时,我的程序无法重新连接到它,并留下错误“Socket已关闭”(由kombu产生
我正在设置CI / CD管道。部署步骤运行以下命令: kubectl apply -f manifest.yml --namespace kubectl rollout status Deploym
关闭。这个问题需要多问focused 。目前不接受答案。 想要改进此问题吗?更新问题,使其仅关注一个问题 editing this post . 已关闭 4 年前。 Improve this ques
这是我在文件上运行 svn info 时输出的一部分: Last Changed Author: [user] Last Changed Rev: 269612 Last Changed Date:
所以我正在构建这个音乐应用程序,到目前为止它只扫描 SD 卡内的特定文件夹。这将返回路径,然后播放它们。 几个小时前我得知android系统中有一个媒体文件数据库所以 我想知道这个媒体文件数据库是否存
我正在绘制树形图,并且想知道如何绘制树类的相对百分比,即 A组=100 B地=30 C地=50 D 地 =20 然后,在图中,应该添加: A 组“50%” B 组“15%” 等在其“Group X”标
我正在构建一个社交网站,我想知道如何在用户首次登录时显示交互式教程和信息。比如只有在第一次登录时,用户才会被要求在他们的个人资料中填写更多信息。我怎样才能通过 php 和 mysql 实现这一点?例子
我是 java servlet 的新手。我研究了一些关于 servlet 的代码,但我真的很想知道更多基本的东西以及它是如何工作的。我只是想知道什么类型的 Material /内容可以从 java s
我想知道是否有办法为 user_id、sender_user_id 和 recipient_user_id 提供 name 信息来自 this fiddle 中的模式. 我现在唯一能想到的办法就是做这
这是我存储2个大学生信息的源代码。我想从输入中获取每个人的姓名、姓氏、ID 和 5 分,然后在输出中显示它们。我在输出中显示分数时遇到问题。 请帮忙 #include using namespace
假设我有一张带有条形图的图像,如下所示: 我想提取条形图和标签的值,除了训练 ML 模型之外,还有其他方法吗? 我有一堆图像,我为其生成了图表和一些描述。我目前正尝试仅从我能够做到的描述中提取信息,但
有没有办法从 GKTurnBasedParticipant 对象中检索玩家的名字?似乎除了根据类引用的难看的 playerID 之外,没有办法显示有关游戏玩家的相关信息。还是我遗漏了什么? 谢谢...
我有一个随机抛出“KeyNotFoundException”的 C# Silverlight 应用程序。我不知道找不到什么 key 。这让我想到了两个问题: KeyNotFoundException
本文实例为大家分享了ios获取本地音频文件的具体代码,供大家参考,具体内容如下 获取本地音频文件地址: ?
下面为大家介绍利用SQL查询语句获取Mysql数据库中表的表名,表描述、字段ID、字段名、数据类型、长度、精度、是否可以为null、默认值、是否自增、是否是主键、列描述 1、查询表信息(表名/表
问题 有没有办法获取代码中使用属性的位置,或声明成员变量的位置? 我不是在寻找解决此问题的方法,只是寻求一个简单的答案,无论这在技术上是否可行。 一些背景信息 我已经定义了一个属性,该属性使用提供给属
我是一名优秀的程序员,十分优秀!