r - 如何按顺序计算因子-6ren

r - 如何按顺序计算因子

转载作者：行者123 更新时间：2023-12-04 18:55:22

25

4

我有一个数据框 df :

userID Score  Task_Alpha Task_Beta Task_Charlie Task_Delta 
3108  -8.00   Easy       Easy      Easy         Easy    
3207   3.00   Hard       Easy      Match        Match
3350   5.78   Hard       Easy      Hard         Hard
3961   10.00  Easy       NA        Hard         Hard
4021   10.00  Easy       Easy      NA           Hard


1. userID is factor variable
2. Score is numeric
3. All the 'Task_' features are factor variables with possible values 'Hard', 'Easy', 'Match' or NA

我想计算 Task_ 之间可能的转换特征。作为引用，可能的转换是:

EE transition from Easy -> Easy
EM transition from Easy -> Match
EH transition from Easy -> Hard
ME transition from Match-> Easy
MM transition from Match-> Match
MH transition from Match-> Hard
HE transition from Hard -> Easy
HM transition from Hard -> Match
HH transition from Hard -> Hard

由于存在三个可能的值(不包括 NA 情况)，输出列如下:

userID  EE  EM  EH  MM  ME  MH  HH  HE  HM
3108    3   0   0   0   0   0   0   0   0
3207    0   1   0   1   0   0   0   1   0
3350    0   0   1   0   0   0   1   1   0
3961    0   0   0   0   0   0   1   0   0
4021    1   0   0   0   0   0   0   0   0

1) 在这个例子中，每个用户 ID 最多可以有 3 个状态转换。

2) 请注意，对于用户 3961 和 4021，NA 减少了可能的状态转换。

对这些问题的任何建议将不胜感激。

数据 dput()是 :

df <- structure(list(
userID = c(3108L, 3207L, 3350L, 3961L, 4021L), 
Score = c(-8, 3, 5.78, 10, 10), 
Task_Alpha = structure(c(1L, 2L, 2L, 1L, 1L), .Label = c("Easy", "Hard"), class = "factor"), 
Task_Beta = structure(c(1L, 1L, 1L, NA, 1L), .Label = "Easy", class = "factor"), 
Task_Charlie = structure(c(1L, 3L, 2L, 2L, NA), .Label = c("Easy", "Hard", "Match"), class = "factor"), 
Task_Delta = structure(c(1L, 3L, 2L, 2L, 2L), .Label = c("Easy", "Hard", "Match"), class = "factor")), 
class = "data.frame", row.names = c(NA, -5L))

最佳答案

另一个选项类似于 Sotos 的方法，但 1) 使用 data.table , 2) 不使用 factor和 3) 替换 table与 Rfast::rowTabulate :

v <- c('Hard', 'Match', 'Easy')
vv <- do.call(paste, expand.grid(v, v))
DT[, (vv) := {
        mat <- mapply(paste, .SD[, -ncol(.SD), with=FALSE], .SD[, -1L])
        as.data.table(Rfast::rowTabulate(matrix(match(mat, vv, 0L), nrow=.N)))
    }, .SDcols=Task_Alpha:Task_Delta]

输出:

   userID Score Task_Alpha Task_Beta Task_Charlie Task_Delta Hard Hard Match Hard Easy Hard Hard Match Match Match Easy Match Hard Easy Match Easy Easy Easy
1:   3108 -8.00       Easy      Easy         Easy       Easy         0          0         0          0           0          0         0          0         3
2:   3207  3.00       Hard      Easy        Match      Match         0          0         0          0           1          1         1          0         0
3:   3350  5.78       Hard      Easy         Hard       Hard         1          0         1          0           0          0         1          0         0
4:   3961 10.00       Easy      <NA>         Hard       Hard         1          0         0          0           0          0         0          0         0
5:   4021 10.00       Easy      Easy         <NA>       Hard         0          0         0          0           0          0         0          0         1

数据:

library(data.table)
library(Rfast)
DT <- structure(list(
    userID = c(3108L, 3207L, 3350L, 3961L, 4021L), 
    Score = c(-8, 3, 5.78, 10, 10), 
    Task_Alpha = structure(c(1L, 2L, 2L, 1L, 1L), .Label = c("Easy", "Hard"), class = "factor"), 
    Task_Beta = structure(c(1L, 1L, 1L, NA, 1L), .Label = "Easy", class = "factor"), 
    Task_Charlie = structure(c(1L, 3L, 2L, 2L, NA), .Label = c("Easy", "Hard", "Match"), class = "factor"), 
    Task_Delta = structure(c(1L, 3L, 2L, 2L, 2L), .Label = c("Easy", "Hard", "Match"), class = "factor")), 
    class = "data.frame", row.names = c(NA, -5L))
setDT(DT)

了解这种方法在实际数据集上的运行速度以及实际数据集是否很大会很有趣。

编辑:添加了一些时间

library(data.table)
nr <- 1e6
vec <- c('Hard', 'Match', 'Easy', NA)
DT <- data.table(userID=1:nr, Task_Alpha=sample(vec, nr, TRUE), Task_Beta=sample(vec, nr, TRUE),
    Task_Charlie=sample(vec, nr, TRUE), Task_Delta=sample(vec, nr, TRUE))
df <- as.data.frame(DT)
DT0 <- copy(DT)
DT1 <- copy(DT)
DT2 <- copy(DT)

mtd0 <- function() {
    t(apply(df[-1L], 1, function(i) {
        i1 <- paste(i[-length(i)], i[-1L]);
        i1 <- factor(i1, levels = do.call(paste, expand.grid(c('Easy', 'Match', 'Hard'),
            c('Easy', 'Match', 'Hard'))));
        table(i1)
    }))
}

mtd1 <- function() {
    f_cols <- names(DT0)[ sapply( DT0, is.factor ) ]
    DT0[, (f_cols) := lapply(.SD, as.character), .SDcols = f_cols ]
    #melt to long format
    DT.melt <- melt( DT0, id.vars = "userID", measure.vars = patterns( task = "^Task_"))
    #set order of Aplha-Beta-etc...
    DT.melt[ grepl( "Alpha",   variable ), order := 1 ]
    DT.melt[ grepl( "Beta",    variable ), order := 2 ]
    DT.melt[ grepl( "Charlie", variable ), order := 3 ]
    DT.melt[ grepl( "Delta",   variable ), order := 4 ]
    #order DT.melt
    setorder( DT.melt, userID, order )
    #fill in codes EE, etc...
    DT.melt[, `:=`( code1 = gsub( "(^.).*", "\\1", value ),
        code2 = gsub( "(^.).*", "\\1", shift( value, type = "lead" ) ) ),
        by = userID ]
    #filter only rows without NA
    DT.melt <- DT.melt[ complete.cases( DT.melt ) ]
    #cast to wide output
    dcast( DT.melt, userID ~ paste0( code2, code1 ), fun.aggregate = length )
}

mtd2 <- function() {
    v <- c('Hard', 'Match', 'Easy')
    vv <- do.call(paste, expand.grid(v, v))
    DT2[, (vv) := {
        mat <- mapply(paste, .SD[, -ncol(.SD), with=FALSE], .SD[, -1L])
        as.data.table(Rfast::rowTabulate(matrix(match(mat, vv, 0L), nrow=.N)))
    }, .SDcols=Task_Alpha:Task_Delta]
}

bench::mark(mtd0(), mtd1(), mtd2(), check=FALSE)

时间:

# A tibble: 3 x 13
  expression      min   median `itr/sec` mem_alloc `gc/sec` n_itr  n_gc total_time result                     memory                 time     gc              
  <bch:expr> <bch:tm> <bch:tm>     <dbl> <bch:byt>    <dbl> <int> <dbl>   <bch:tm> <list>                     <list>                 <list>   <list>          
1 mtd0()        2.19m    2.19m   0.00760     252MB    2.26      1   297      2.19m <int[,9] [1,000,000 x 9]>  <df[,3] [171,481 x 3]> <bch:tm> <tibble [1 x 3]>
2 mtd1()       33.16s   33.16s   0.0302      856MB    0.754     1    25     33.16s <df[,10] [843,688 x 10]>   <df[,3] [8,454 x 3]>   <bch:tm> <tibble [1 x 3]>
3 mtd2()     844.95ms 844.95ms   1.18        298MB    1.18      1     1   844.95ms <df[,14] [1,000,000 x 14]> <df[,3] [8,912 x 3]>   <bch:tm> <tibble [1 x 3]>

关于r - 如何按顺序计算因子，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58745713/

25

4

0

文章推荐： javascript - 如何通过 id 存储在变量中来渲染组件？

文章推荐： python - 静态方法如何不绑定(bind)到 "staticmethod"类？

文章推荐： apache-kafka - Apache Kafka 分区保证中的消息顺序

r - (因子)数据帧列的小写
我有这种格式的data.frame: 'data.frame': 244 obs. of 1 variable: $ names: Factor w/ 244 levels "ERA","BA
Java查询求解拉伸(stretch)因子
这就是问题: write a Java Program that accepts a String and an integer stretch factor P as parameters and
r - 基于另一列的 block 因子
该示例显示了不同工厂的产量测量值，第一列表示工厂最后一列是生产量。 factory % mutate(factory=fct_lump(factory,2)) factory produc
r - 分类变量(因子)与虚拟变量的区别
我正在使用分类变量运行回归并遇到 this question .在这里，用户想要为每个虚拟对象添加一列。这让我很困惑，因为我虽然列有很长的数据，包括使用 as.factor() 存储的所有虚拟数据。相
r - 修改 R 因子？
假设在 R 中有一个 Data.Frame 对象，其中所有字符列都已转换为因子。然后我需要“修改”与数据帧中某一行相关联的值——但将其编码为一个因子。我首先需要提取一行，所以这就是我正在做的。这是一个
r - 计算一个数字(因子)在每组中出现的次数
利用下面的可重现数据， dat head(dat) Bin Number 1 1 3 2 1 5 3 1 4 4 1 5 5 1
R:删除具有预定出现频率和自动更新因子水平的变量(因子)的行
我有一组包含多个变量的数据。其中一个变量 - 阶乘包含组的名称 - A、B、C 等。其余变量是数字。 > data1 Group Value 1 A 23 2 A
r - 虚拟变量到 R 中的单个分类变量(因子)
我有一组编码为二项式的变量。 Pre VALUE_1 VALUE_2 VALUE_3 VALUE_4 VALUE_5 VALUE_6 VALUE_7 VALUE_8 1 1 0
r - 将各种虚拟/逻辑变量从 R 中的名称转换为单个分类变量/因子
我的问题与 this one 非常相似和 this other one ，但我的数据集有点不同，我似乎无法使这些解决方案起作用。如果我误解了什么并且这个问题是多余的，请原谅。我有一个这样的数据集:
r - ggplot2 因子 x 变量打破 geom_area
我一直在尝试生成一个带有离散 x 变量的堆积面积图(因为我想显示财政年度，即“2013/14”，而不是日历年)。但是，将 x 轴变量转换为一个因子会阻止在最终图表中呈现 geom。有解决办法吗？ l
java - 具有 1.0 maxLoad 因子、时间复杂度的哈希表
只是一个简单的问题来确认我的想法，使用负载因子 1.0 的哈希表的复杂性将是二次时间，用以下符号 O(n^2) 表示。这是因为必须不断调整大小并一遍又一遍地插入。如果我错了，请纠正我。谢谢最佳
r - 因子 MSZoning 具有新级别 NA(数据中有新因子，但线性回归模型中没有)
我正在尝试使用 kaggle 的一些数据集进行房价预测。这是我的代码 library(ggplot2) dataset=read.csv('train(1).csv') dataset_test=r
javascript - 如何构建操纵 DOM 的 Angular 因子/服务
我正在用 Angular 构建一个类似咆哮的 UI。我想将其公开为工厂(或服务)，以使其在我的 Controller 中可用。调用 Growl.add 将导致 DOM 发生变化，所以看起来我应该有一个
python - 将 Pandas Dataframe 列转换为 R 因子
我正在尝试将 pandas 数据框的一列转换为因数，因为我试图在 R 中调用的函数需要因数。 pandas2ri.activate() #second column of labels has
R plotly x 轴字符/因子(组合数字和 -)。绘图仅显示仅包含数字的轴。漏洞？
我正在尝试使用 plotly 绘制一个以字符串(组合数)作为 x 轴的条形图。 (“1”、“2”、“3”、“4 - 5”、“6 - 8”、“9 - 13”、“14 - 21”、“22 - 34”、“3
因子()和 NAs 的 R caret/rfe 变量选择
我有一个包含 NA 的数据集。此外，它还有一些列需要factors()。我正在使用 caret 包中的 rfe() 函数来选择变量。似乎 rfe() 中的 functions= 参数使用 lmF
r - 如何防止 write.csv 将 POSIXct、日期和时间类更改回字符/因子？
我有一个 .csv 文件，其中每个字段用于日期时间、日期和时间。最初它们都是字符字段，我已经相应地转换了它们。在我的代码结束时，如果我这样做: str(data) 我会得到 datetime: P
r - R 中的 NaiveBayes 无法预测 - 因子 (0) 级别 :
我有一个如下所示的数据集: data.flu data.flu chills runnyNose headache fever flu 1 1 0 M
c++ - QMainWindow::splitDockWidget 的 QDockWidget 拉伸(stretch)因子？
我正在使用 QMainWindow 在 C++ 中手动布置 Qt 应用程序。我希望在屏幕底部有两个并排停靠的小部件，但我希望它们具有不成比例的宽度。目前，我只能让它们具有相同的宽度。有没有办法设置拉伸
java - 使用 Java 计算 MOS、抖动和 R 因子
我需要通过在两个主机(2 个 Java 进程)之间发送合成调用来计算 VOIP 质量。我应该找出 MOS、抖动和 R 因子(VOIP 质量指标)。根据目前的研究，我发现我应该在两台主机之间发送 RTP

首页

博学

6Ren·AI

商城

r - 如何按顺序计算因子