r - 在R中将逗号分隔的字符串拆分为(稀疏) bool 矩阵的快速方法-6ren

r - 在R中将逗号分隔的字符串拆分为(稀疏) bool 矩阵的快速方法

转载作者：行者123 更新时间：2023-12-05 00:42:28

24

4

我有一个风格的数据框

id choice
----------
1  "(a,b,c)"
2  "(c)"
3  "(a,c)"
4  "(d)"

即

DF = data.frame(id=c(1,2,3,4), choice=c("(a,b,c))","(c)","(a,c)","(d)"))

我想获得一个带有 bool 列的数据框

id a b c d
----------
1  T T T F
2  F F T F
3  F F T F
4  F F F T

基于 Split comma-separated strings into boolean columns我尝试使用

library(splitstackshape)
cSplit_e(DF, "choice", sep = "[,()]", mode = "binary", 
         type = "character", fill = 0, drop = TRUE, fixed = FALSE)

但是，我的实际数据帧内存不足(我有大约 1000 万行和大约 150 万个唯一选择值(预先不知道的数字))并且通常也很慢。

因此，我想知道是否有更快、内存效率更高的方法来执行此操作，例如使用 data.table 或 dplyr 或 multidplyr 并且也许还以稀疏格式存储 bool 矩阵？

在我的实际数据集中 choice 是可能的氨基酸突变，所以不是 a,b,c, ... 例如

(NSP5_P132H,Spike_H69del,Spike_T95I,Spike_A67V,Spike_N969K,Spike_H655Y,Spike_N856K,N_R203K,Spike_G142D,NSP3_A1892T,Spike_Q954H,N_P13L,NSP3_L1266I,N_R32del,M_Q19E,NSP4_T492I,NSP6_L105del,Spike_N679K,Spike_N764K,Spike_L212I,NSP6_G107del,NSP6_I189V,Spike_T547K,M_D3G,Spike_D796Y,N_G204R,Spike_V143del,M_A63T,Spike_K417N)

而且我没有数据集中可能发生的突变的先验列表 - 所以我不知道我的先验选择(大约有 150 万个独特的选择)...

这是我实际数据集的前 100 行:

library(readr)
DF = read_csv("https://www.dropbox.com/s/v1dhbzmlyudxvyi/DF.csv?dl=1")
DF$id = 1:nrow(DF)

EDIT2:如果不是因为我最终会得到一个包含 150 万列和 1000 万行的数据表，它不再适合内存我的机器。我想最终将它存储为稀疏矩阵真的有必要吗？

最佳答案

你可以试试下面的 dcast + strsplit

dcast(
  setDT(DF)[
    ,
    .(choice = Filter(nzchar, unlist(strsplit(choice, "\\W+")))),
    id
  ],
  id ~ choice,
  fun.aggregate = function(x) length(x) > 0
)

给了

   id     a     b     c     d
1:  1  TRUE  TRUE  TRUE FALSE
2:  2 FALSE FALSE  TRUE FALSE
3:  3  TRUE FALSE  TRUE FALSE
4:  4 FALSE FALSE FALSE  TRUE

关于r - 在R中将逗号分隔的字符串拆分为(稀疏) bool 矩阵的快速方法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/73758344/

24

4

0

文章推荐： ajax - 当 session 过期时，网站通常如何自动注销用户？

文章推荐： architecture - 使用 CouchDB 后端设计日志系统

文章推荐： bash - 没有记号的边界之间规则间隔的数字

javascript - 多个选择的复选框下拉列表由 ; 分隔
我正在尝试从下拉列表中创建一个多选复选框，并通过 ; 连接所选结果。我的代码是这样的: var myobject = { ValueA : 'Text A', ValueB : 'T
javascript - 获取输入值并以 "|"分隔
我有输入，我需要获取值并用 “|” 符号分隔。我的输入: 输出我需要的: 00:00|00:00|00:00 我的代码是: (而且它不工作) var timesArray = $('table').
mysql - 数据库中的拆分数字由破折号 (-) 分隔
我正在尝试将超过 400 万行的列拆分为 4 个新列，问题是我不知道在哪里查看或我应该使用 Google 搜索哪个术语。 (是的，我已经在 Google 和 Stack 中搜索了一个类似的问题，但只在
javascript - 分隔 .CSV 文件中的数字
我有一个很大的 csv 文件，其中充满了用“|”分隔的数字字符，例如: 432452 | 543634 4122442 | 41256512 64523 | 12416 然后我读入数据如下: fs
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - java中根据 "."分隔 double
这个问题已经有答案了: 奥 git _a (6 个回答) 已关闭 9 年前。我有一个双数“547.123456” 我只想使用这个 double 作为“547.1”，就像“.”后面只有 1 个数字我
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - 分隔 arraylist 的元素
我有一个 ArrayList，其中包含一个 messageId、一个 -、一个用户名。示例:E123-sam 我想划分 List 的每个元素，使得 - 之前的部分进入一个 ArrayList ，而之
python - 分隔 Pandas 数据框中共享同一列的月份和年份
我目前有一个“日期”列作为 pandas 数据框的索引，其格式为: January February .... Year2 January February ... Year3 (它来自 pdf 表格
c - mdb工具sql查询表 namespace 分隔
我正在尝试对我的 .mdb 数据库进行 ODBC 查询。我正在使用 mdbtools 驱动程序。该代码是使用 Eclipse 用 C 语言编写的。唯一的问题是，当我写例如: "SELECT 'last
java - 分隔 "if else"语句
我需要知道如何将这两个if else 部分分开。 public static int NextBday(int Bdays, int days){ int daysleft = 0;
mysql - 如何使用计数一列并由每个 id 分隔
我想计算我的员工分开但合并在一起的出勤率 My target output 我的代码 SELECT count(employees_id) as numbers FROM attendance WH
php - 我想在一个单独的列中插入多封电子邮件，并用 # 分隔
关闭。这个问题需要details or clarity .它目前不接受答案。想改进这个问题吗？通过 editing this post 添加细节并澄清问题. 关闭 7 年前。 Improve t
java - 分隔 arraylist 中的每个项目
下面是我的代码的一小段摘录，它从 API 添加了一行。总共有很多行。每一行包含一行数据如 TY8tr,50,34,P,SB, 数据行在数据类型上是一致的。我如何通过 ,'s 拆分数组列表中
javascript - 获取选中的元素并用逗号分隔它们，最后一个元素用 "and"分隔
我想获取选中的元素并用逗号分隔它们，最后一个元素用“and”分隔它的显示输出为: 我想删除最后一个元素后面的逗号 (,) 并在它前面添加 'and'，例如 Sugar, Milk and Extra
javascript - 分隔 JSON 对象的值
我是 JSON 的新手，但在从已解析的 JSON 对象中提取数据时遇到问题: 我有一个 getstats.php 文件，它回显 mysql 查询的 json 编码结果。以下是 php 文件返回的示例:
C++ 字符串解析以 0 分隔
我有一个像这样的数字/字符串(我不确定如何将 int 与字符串相互转换) 000000122310200000223340000700012220000011411000000011011271043

python - 分隔

标签内的文本

我想尝试一些基本的网络抓取，但遇到了一个问题，因为我习惯了简单的 td-tags，在这种情况下，我有一个网页，其中包含以下预标记和其中的所有文本，这意味着刮掉它有点棘手。 11111111 1111

C# 分隔 TCP 消息
出于练习目的，我正在开发 TCP 客户端/服务器系统，我想在两者之间发送特定数据。我已经能够发送字节并让它们显示为字符串。此外，我还可以发送一个特定的字符串(“mb”)并在服务器端弹出一个 Mess
java - 分隔 Unicode 连字字符
在大量的 unicode 字符中，有一些实际上表示多个字符，例如两个 'f' 字符的 U+FB00 连字 ff。有什么方法可以轻松地将这样的字符转换为多个单个字符？最好是标准 Java API 中可用

首页

博学

6Ren·AI

商城

r - 在R中将逗号分隔的字符串拆分为(稀疏) bool 矩阵的快速方法