r - 枚举因子水平的实例-6ren

r - 枚举因子水平的实例

转载作者：行者123 更新时间：2023-12-01 01:12:34

25

4

我有一个包含 150000 行长格式的数据框，其中多次出现相同的 id 变量。我正在使用 reshape(来自 stat，而不是 package=reshape(2))将其转换为宽格式。我正在生成一个变量来计算给定级别 id 的每次出现以用作索引。

我已经使用 plyr 处理了一个小数据框，但是对于我的完整 df 来说它太慢了。我可以更有效地编程吗？

我一直在用 reshape 包努力做到这一点，因为我有大约 30 个其他变量。对于每个单独的分析，最好只 reshape 我正在查看的内容(而不是整个 df)。

> # u=id variable with three value variables 
> u<-c(rep("a",4), rep("b", 3),rep("c", 6), rep("d", 5))
> u<-factor(u)
> v<-1:18
> w<-20:37
> x<-40:57
> df<-data.frame(u,v,w,x)
> df
   u  v  w  x
1  a  1 20 40
2  a  2 21 41
3  a  3 22 42
4  a  4 23 43
5  b  5 24 44
6  b  6 25 45
7  b  7 26 46
8  c  8 27 47
9  c  9 28 48
10 c 10 29 49
11 c 11 30 50
12 c 12 31 51
13 c 13 32 52
14 d 14 33 53
15 d 15 34 54
16 d 16 35 55
17 d 17 36 56
18 d 18 37 57
> 
> library(plyr)
> df2<-ddply(df, .(u), transform, count=rank(u, ties.method="first")) 
> df2
   u  v  w  x count
1  a  1 20 40     1
2  a  2 21 41     2
3  a  3 22 42     3
4  a  4 23 43     4
5  b  5 24 44     1
6  b  6 25 45     2
7  b  7 26 46     3
8  c  8 27 47     1
9  c  9 28 48     2
10 c 10 29 49     3
11 c 11 30 50     4
12 c 12 31 51     5
13 c 13 32 52     6
14 d 14 33 53     1
15 d 15 34 54     2
16 d 16 35 55     3
17 d 17 36 56     4
18 d 18 37 57     5
> reshape(df2, idvar="u", timevar="count", direction="wide")
   u v.1 w.1 x.1 v.2 w.2 x.2 v.3 w.3 x.3 v.4 w.4 x.4 v.5 w.5 x.5 v.6 w.6 x.6
1  a   1  20  40   2  21  41   3  22  42   4  23  43  NA  NA  NA  NA  NA  NA
5  b   5  24  44   6  25  45   7  26  46  NA  NA  NA  NA  NA  NA  NA  NA  NA
8  c   8  27  47   9  28  48  10  29  49  11  30  50  12  31  51  13  32  52
14 d  14  33  53  15  34  54  16  35  55  17  36  56  18  37  57  NA  NA  NA

最佳答案

我仍然无法弄清楚为什么您希望最终将数据集从宽转换为长，因为对我来说，这似乎是一个非常难以处理的数据集。

如果您希望加快因子水平的枚举，可以考虑使用 ave()在基数 R 中，或 .N来自“data.table”包。考虑到您正在处理很多行，您可能需要考虑后者。

首先，让我们整理一些数据:

set.seed(1)
df <- data.frame(u = sample(letters[1:6], 150000, replace = TRUE),
                 v = runif(150000, 0, 10),
                 w = runif(150000, 0, 100),
                 x = runif(150000, 0, 1000))
list(head(df), tail(df))
# [[1]]
#   u        v        w        x
# 1 b 6.368412 10.52822 223.6556
# 2 c 6.579344 75.28534 450.7643
# 3 d 6.573822 36.87630 283.3083
# 4 f 9.711164 66.99525 681.0157
# 5 b 5.337487 54.30291 137.0383
# 6 f 9.587560 44.81581 831.4087
# 
# [[2]]
#        u        v        w        x
# 149995 b 4.614894 52.77121 509.0054
# 149996 f 5.104273 87.43799 391.6819
# 149997 f 2.425936 60.06982 160.2324
# 149998 a 1.592130 66.76113 118.4327
# 149999 b 5.157081 36.90400 511.6446
# 150000 a 3.565323 92.33530 252.4982
table(df$u)
# 
#     a     b     c     d     e     f 
# 25332 24691 24993 24975 25114 24895

加载我们需要的包:

library(plyr)
library(data.table)

创建我们数据集的“data.table”版本

DT <- data.table(df, key = "u")
DT # Notice that the data are now automatically sorted
#         u         v         w        x
#      1: a 6.2378578 96.098294 643.2433
#      2: a 5.0322400 46.806132 544.6883
#      3: a 9.6289786 87.915303 334.6726
#      4: a 4.3393403  1.994383 753.0628
#      5: a 6.2300123 72.810359 579.7548
#     ---                               
# 149996: f 0.6268414 15.608049 669.3838
# 149997: f 2.3588955 40.380824 658.8667
# 149998: f 1.6383619 77.210309 250.7117
# 149999: f 5.1042725 87.437989 391.6819
# 150000: f 2.4259363 60.069820 160.2324
DT[, .N, by = key(DT)] # Like "table"
#    u     N
# 1: a 25332
# 2: b 24691
# 3: c 24993
# 4: d 24975
# 5: e 25114
# 6: f 24895

现在让我们运行一些基本测试。来自 ave() 的结果没有排序，但它们在“data.table”和“plyr”中，所以我们还应该测试使用 ave()时排序的时序.

system.time(AVE <- within(df, {
  count <- ave(as.numeric(u), u, FUN = seq_along)
}))
#    user  system elapsed 
#   0.024   0.000   0.027 

# Now time the sorting
system.time(AVE2 <- AVE[order(AVE$u, AVE$count), ])
#    user  system elapsed 
#   0.264   0.000   0.262 

system.time(DDPLY <- ddply(df, .(u), transform, 
                           count=rank(u, ties.method="first")))
#    user  system elapsed 
#   0.944   0.000   0.984 

system.time(DT[, count := 1:.N, by = key(DT)])
#    user  system elapsed 
#   0.008   0.000   0.004 

all(DDPLY == AVE2)
# [1] TRUE
all(data.frame(DT) == AVE2)
# [1] TRUE

“data.table”的语法确实很紧凑，而且速度非常快!

关于r - 枚举因子水平的实例，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/14481747/

25

4

0

文章推荐： android-ndk - 用于 objective-c 的 Android NDK

文章推荐： CakePHP - 如何在 Html 帮助程序超链接中插入新行/换行符

文章推荐： tridion - Tridion UI(体验管理器)的事件系统错误

r - (因子)数据帧列的小写
我有这种格式的data.frame: 'data.frame': 244 obs. of 1 variable: $ names: Factor w/ 244 levels "ERA","BA
Java查询求解拉伸(stretch)因子
这就是问题: write a Java Program that accepts a String and an integer stretch factor P as parameters and
r - 基于另一列的 block 因子
该示例显示了不同工厂的产量测量值，第一列表示工厂最后一列是生产量。 factory % mutate(factory=fct_lump(factory,2)) factory produc
r - 分类变量(因子)与虚拟变量的区别
我正在使用分类变量运行回归并遇到 this question .在这里，用户想要为每个虚拟对象添加一列。这让我很困惑，因为我虽然列有很长的数据，包括使用 as.factor() 存储的所有虚拟数据。相
r - 修改 R 因子？
假设在 R 中有一个 Data.Frame 对象，其中所有字符列都已转换为因子。然后我需要“修改”与数据帧中某一行相关联的值——但将其编码为一个因子。我首先需要提取一行，所以这就是我正在做的。这是一个
r - 计算一个数字(因子)在每组中出现的次数
利用下面的可重现数据， dat head(dat) Bin Number 1 1 3 2 1 5 3 1 4 4 1 5 5 1
R:删除具有预定出现频率和自动更新因子水平的变量(因子)的行
我有一组包含多个变量的数据。其中一个变量 - 阶乘包含组的名称 - A、B、C 等。其余变量是数字。 > data1 Group Value 1 A 23 2 A
r - 虚拟变量到 R 中的单个分类变量(因子)
我有一组编码为二项式的变量。 Pre VALUE_1 VALUE_2 VALUE_3 VALUE_4 VALUE_5 VALUE_6 VALUE_7 VALUE_8 1 1 0
r - 将各种虚拟/逻辑变量从 R 中的名称转换为单个分类变量/因子
我的问题与 this one 非常相似和 this other one ，但我的数据集有点不同，我似乎无法使这些解决方案起作用。如果我误解了什么并且这个问题是多余的，请原谅。我有一个这样的数据集:
r - ggplot2 因子 x 变量打破 geom_area
我一直在尝试生成一个带有离散 x 变量的堆积面积图(因为我想显示财政年度，即“2013/14”，而不是日历年)。但是，将 x 轴变量转换为一个因子会阻止在最终图表中呈现 geom。有解决办法吗？ l
java - 具有 1.0 maxLoad 因子、时间复杂度的哈希表
只是一个简单的问题来确认我的想法，使用负载因子 1.0 的哈希表的复杂性将是二次时间，用以下符号 O(n^2) 表示。这是因为必须不断调整大小并一遍又一遍地插入。如果我错了，请纠正我。谢谢最佳
r - 因子 MSZoning 具有新级别 NA(数据中有新因子，但线性回归模型中没有)
我正在尝试使用 kaggle 的一些数据集进行房价预测。这是我的代码 library(ggplot2) dataset=read.csv('train(1).csv') dataset_test=r
javascript - 如何构建操纵 DOM 的 Angular 因子/服务
我正在用 Angular 构建一个类似咆哮的 UI。我想将其公开为工厂(或服务)，以使其在我的 Controller 中可用。调用 Growl.add 将导致 DOM 发生变化，所以看起来我应该有一个
python - 将 Pandas Dataframe 列转换为 R 因子
我正在尝试将 pandas 数据框的一列转换为因数，因为我试图在 R 中调用的函数需要因数。 pandas2ri.activate() #second column of labels has
R plotly x 轴字符/因子(组合数字和 -)。绘图仅显示仅包含数字的轴。漏洞？
我正在尝试使用 plotly 绘制一个以字符串(组合数)作为 x 轴的条形图。 (“1”、“2”、“3”、“4 - 5”、“6 - 8”、“9 - 13”、“14 - 21”、“22 - 34”、“3
因子()和 NAs 的 R caret/rfe 变量选择
我有一个包含 NA 的数据集。此外，它还有一些列需要factors()。我正在使用 caret 包中的 rfe() 函数来选择变量。似乎 rfe() 中的 functions= 参数使用 lmF
r - 如何防止 write.csv 将 POSIXct、日期和时间类更改回字符/因子？
我有一个 .csv 文件，其中每个字段用于日期时间、日期和时间。最初它们都是字符字段，我已经相应地转换了它们。在我的代码结束时，如果我这样做: str(data) 我会得到 datetime: P
r - R 中的 NaiveBayes 无法预测 - 因子 (0) 级别 :
我有一个如下所示的数据集: data.flu data.flu chills runnyNose headache fever flu 1 1 0 M
c++ - QMainWindow::splitDockWidget 的 QDockWidget 拉伸(stretch)因子？
我正在使用 QMainWindow 在 C++ 中手动布置 Qt 应用程序。我希望在屏幕底部有两个并排停靠的小部件，但我希望它们具有不成比例的宽度。目前，我只能让它们具有相同的宽度。有没有办法设置拉伸
java - 使用 Java 计算 MOS、抖动和 R 因子
我需要通过在两个主机(2 个 Java 进程)之间发送合成调用来计算 VOIP 质量。我应该找出 MOS、抖动和 R 因子(VOIP 质量指标)。根据目前的研究，我发现我应该在两台主机之间发送 RTP

首页

博学

6Ren·AI

商城

r - 枚举因子水平的实例