- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我想将离散(标识符)变量转换为一系列逻辑列,以便我可以将该变量用作逻辑回归函数(和其他函数)中的特征,而我无法混合连续值和离散值。
我在数据框中有一个因子列,我想将该列转换为逻辑值的列矩阵(1..“级别数”),例如:
my_labels=c("a","b","c","d","e","f")
my_tally=c(1,1,3,2,3,4,5,1)
my_tally=factor(my_tally, levels=c(1:6), labels=my_labels)
summary(my_tally)
expected_output=c(1,0,0,0,0,0, #1
1,0,0,0,0,0, #1
0,0,1,0,0,0, #3
0,1,0,0,0,0, #2
0,0,1,0,0,0, #3
0,0,0,1,0,0, #4
0,0,0,0,1,0, #5
1,0,0,0,0,0 #1
)
expected_output=matrix(expected_output,
nrow=length(my_tally),
ncol=length(levels(my_tally)),
byrow=TRUE
)
expected_output
colSums(expected_output)
对于产生预期输出的“快速”函数有什么建议吗?这是一个大数据问题(700 个离散可能性,1M 个观察值)。
最佳答案
这里有 2 种解决方案,一种使用基本 R,在较小的数据集上速度更快,另一种使用 Matrix
包中的稀疏矩阵,在较大的数据集上速度非常快。
创建仅用 0 填充的矩阵
mat <- matrix(0, nrow=length(my_tally), ncol=length(levels(my_tally)))
在适当的情况下使用索引分配 1:
mat[cbind(1:length(my_tally), as.numeric(my_tally))] <- 1
# [,1] [,2] [,3] [,4] [,5] [,6]
#[1,] 1 0 0 0 0 0
#[2,] 1 0 0 0 0 0
#[3,] 0 0 1 0 0 0
#[4,] 0 1 0 0 0 0
#[5,] 0 0 1 0 0 0
#[6,] 0 0 0 1 0 0
#[7,] 0 0 0 0 1 0
#[8,] 1 0 0 0 0 0
colSums(mat)
#[1] 3 1 2 1 1 0
library(Matrix)
colSums(sparseMatrix(i=1:length(my_tally), j=as.numeric(my_tally),
dims=c(length(my_tally), length(levels(my_tally)))))
#[1] 3 1 2 1 1 0
以下是针对较大样本数据集(260 个级别,100,000 个元素)的一些基准测试,您可以在其中真正看到使用稀疏矩阵的好处:
# Sample data
my_labels <- c(LETTERS, letters, paste0(LETTERS, letters), paste0(letters, LETTERS),
paste0(letters, letters, letters), paste0(LETTERS, LETTERS, LETTERS),
paste0(LETTERS, letters, LETTERS), paste0(letters, LETTERS, letters),
paste0(LETTERS, letters, letters), paste0(letters, LETTERS, LETTERS))
my_tally <- sample(1:260, 100000, replace=TRUE)
my_tally <- factor(my_tally, levels=c(1:260), labels=my_labels)
# Benchmarks
library(microbenchmark)
microbenchmark(
Robert <- colSums(table(1:length(my_tally),my_tally)),
Frank1 <- {mat <- matrix(0, nrow=length(my_tally), ncol=length(levels(my_tally)))
mat[cbind(1:length(my_tally), as.numeric(my_tally))] <- 1
colSums(mat)},
Frank2 <- colSums(sparseMatrix(i=1:length(my_tally), j=as.numeric(my_tally),
dims=c(length(my_tally), length(levels(my_tally))))),
Khashaa <- colSums(diag(length(my_labels))[my_tally, ])
)
lq mean median uq max neval cld
Robert 444.625026 486.130804 461.653480 548.755603 632.1418 100 d
Frank1 328.947431 358.538855 337.136012 360.727606 458.2305 100 c
Frank2 4.241506 8.997434 4.354615 4.519896 135.3001 100 a
Khashaa 224.675094 256.337639 237.905714 260.163725 375.5642 100 b
关于R : convert discrete column into matrix of logical values,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/31139307/
我正在尝试使用 flot 绘制 SQL 数据库中的数据图表,这是使用 php 收集的,然后使用 json 编码的。 目前看起来像: [{"month":"February","data":482},
我有一个来自 php 行的 json 结果,类似于 ["value"]["value"] 我尝试使用内爆函数,但得到的结果是“value”“value” |id_kategori|created_at
脚本 1 将记录 two 但浏览器仍会将 select 元素呈现为 One。该表单还将提交值 one。 脚本 2 将记录、呈现和提交 两个。我希望它们是同义词并做同样的事情。请解释它们为何不同,以及我
我的python字典结构是这样的: ips[host][ip] 每行 ips[host][ip] 看起来像这样: [host, ip, network, mask, broadcast, mac, g
在 C# 中 我正在关注的一本书对设置和获取属性提出了这样的建议: double pri_test; public double Test { get { return pri_test; }
您可能熟悉 enum 位掩码方案,例如: enum Flags { FLAG1 = 0x1, FLAG2 = 0x2, FLAG3 = 0x4, FLAG4 = 0x8
在一些地方我看到了(String)value。在一些地方value.toString() 这两者有什么区别,在什么情况下我需要使用哪一个。 new Long(value) 和 (Long)value
有没有什么时候 var result = !value ? null : value[0]; 不会等同于 var result = value ? value[0] : null; 最佳答案 在此处将
我正在使用扫描仪检测设备。目前,我的条形码的值为 2345345 A1。因此,当我扫描到记事本或文本编辑器时,输出将类似于 2345345 A1,这是正确的条形码值。 问题是: 当我第一次将条形码扫描
我正在读取 C# 中的资源文件并将其转换为 JSON 字符串格式。现在我想将该 JSON 字符串的值转换为键。 例子, [ { "key": "CreateAccount", "text":
我有以下问题: 我有一个数据框,最多可能有 600 万行左右。此数据框中的一列包含某些 ID。 ID NaN NaN D1 D1 D1 NaN D1 D1 NaN NaN NaN NaN D2 NaN
import java.util.*; import java.lang.*; class Main { public static void main (String[] args) thr
我目前正在开发我的应用程序,使其设计基于 Holo 主题。在全局范围内我想做的是工作,但我对文件夹 values、values-v11 和 values-v14. 所以我知道: values 的目标是
我遇到了一个非常奇怪的问题。 我的公司为我们的各种 Assets 使用集中式用户注册网络服务。我们一般通过HttpURLConnection使用请求方法GET向Web服务发送请求,通过qs设置参数。这
查询: UPDATE nominees SET votes = ( SELECT votes FROM nominees WHERE ID =1 ) +1 错误: You can't specify
如果我运行一段代码: obj = {}; obj['number'] = 1; obj['expressionS'] = 'Sin(0.5 * c1)'; obj['c
我正在为我的应用创建一个带有 Twitter 帐户的登录页面。当我构建我的项目时会发生上述错误。 values/strings.xml @dimen/abc_text_size_medium
我在搜索引擎中使用以下 View : CREATE VIEW msr_joined_view AS SELECT table1.id AS msr_id, table1.msr_number, tab
为什么验证会返回此错误。如何解决? ul#navigation li#navigation-3 a.current Value Error : background-position Too
我有一个数据名如下 import pandas as pd d = { 'Name' : ['James', 'John', 'Peter', 'Thomas', 'Jacob', 'Andr
我是一名优秀的程序员,十分优秀!