R标准化数据框中的数字变量，同时保留因子变量-6ren

R标准化数据框中的数字变量，同时保留因子变量

转载作者：行者123 更新时间：2023-12-04 10:27:40

25

4

我在 R 中加载了一个数据框 (dcc)，我已经缩小范围以完成案例。

str(dcc)

'data.frame':   41715 obs. of  9 variables:
 $ XCoord                  : num  661382 661412 661442 661472 661502 ...
 $ YCoord                  : num  648092 648092 648092 648092 648092 ...
 $ OBJECTID                : int  1 2 3 4 5 6 7 8 9 10 ...
 $ POINTID                 : int  1 2 3 4 5 6 7 8 9 10 ...
 $ GRID_CODE               : int  0 0 0 0 0 0 0 0 0 0 ...
 $ APPL_COST_DIST_RIV_COAST: num  21350 21674 22185 22748 23448 ...
 $ APPL_DEM30              : int  785 793 792 769 765 777 784 789 781 751 ...
 $ APPL_DEM30_SLOPE        : num  19.7 13.3 18.6 23.2 21 ...
 $ APPL_SITE_NONSITE       : Factor w/ 2 levels "0","1": 1 1 1 1 1 1 1 1 1 1 ...

我想通过减去平均值并除以标准偏差来标准化数字和整数变量。当我应用以下代码时，我无意中从数据框中删除了因子变量 APPL_SITE_NONSITE:

ind <- sapply(dcc, is.numeric)
dcc.s<-sapply(dcc[,ind], function(x) (x-mean(x))/sd(x))
dcc.s<-data.frame(dcc.s)

如果我没记错的话，发生这种情况是因为该变量的 ind=FALSE。似乎我需要 for 循环和 if/else 语句的某种组合来标准化数字变量并单独保留因子变量。我已经尝试了许多排列，但不断出现错误。例如，以下代码:

dcc.s <- for (i in 1:ncol(dcc)){ sapply(dcc[,i],
if (is.numeric(dcc[,i])==TRUE) {
function(x) (x-mean(x))/sd(x) }
 else {dcc[,i]})
}

返回错误:

match.fun(FUN) 中的错误:
c("'if (is.numeric(dcc[, i]) == TRUE) {' 不是函数、字符或符号", "' function(x) (x - mean(x))/sd(x )' 不是函数、字符或符号", "'} else {' 不是函数、字符或符号", "' dcc[, i]' 不是函数、字符或符号", "'}'不是函数、字符或符号")

也许这是一个简单的格式错误或错位的括号，但我完全被卡住了。如果有更优雅的方法来做到这一点，我对其他方法持开放态度。任何帮助将非常感激。

最佳答案

您需要使用 rapply 而不是 sapply

set.seed(1)
> df=data.frame(A=rnorm(10),b=1:10,C=as.factor(rep(1:2,5)))
> str(df)
'data.frame':   10 obs. of  3 variables:
 $ A: num  -0.626 0.184 -0.836 1.595 0.33 ...
 $ b: int  1 2 3 4 5 6 7 8 9 10
 $ C: Factor w/ 2 levels "1","2": 1 2 1 2 1 2 1 2 1 2

您需要使用的代码:

> D=rapply(df,scale,c("numeric","integer"),how="replace")
> D
             A          b C
1  -0.97190653 -1.4863011 1
2   0.06589991 -1.1560120 2
3  -1.23987805 -0.8257228 1
4   1.87433300 -0.4954337 2
5   0.25276523 -0.1651446 1
6  -1.22045645  0.1651446 2
7   0.45507643  0.4954337 1
8   0.77649606  0.8257228 2
9   0.56826358  1.1560120 1
10 -0.56059319  1.4863011 2
> str(D)
'data.frame':   10 obs. of  3 variables:
 $ A: num [1:10, 1] -0.9719 0.0659 -1.2399 1.8743 0.2528 ...
  ..- attr(*, "scaled:center")= num 0.132
  ..- attr(*, "scaled:scale")= num 0.781
 $ b: num [1:10, 1] -1.486 -1.156 -0.826 -0.495 -0.165 ...
  ..- attr(*, "scaled:center")= num 5.5
  ..- attr(*, "scaled:scale")= num 3.03
 $ C: Factor w/ 2 levels "1","2": 1 2 1 2 1 2 1 2 1 2
>

关于R标准化数据框中的数字变量，同时保留因子变量，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/48633147/

25

4

0

文章推荐：在 R 中读取半结构化文本文件

文章推荐： r - ggplot2 用一些 x 轴跳动绘制 3 个因子

文章推荐： r - 设置打印的默认小数位数

文章推荐： r - 如何在R中将表列表转换为数据框

MVVM 标准化
某人在 Silverlight posted MVVM 目前缺乏标准化，所以每个人都有自己的风格.. 这就是为什么我和 WPF Disciples 的一些人正在积极讨论每个人都同意的 MVVM 元素。
r - 标准化/缩放数据集
我有以下数据集: dat tests2 * 20 Score 1 13.333333 2 10.666667 3 2.666667 4 9.333333 5 13.3333
c# - “标准化”概率数组
我有一个 double 组，表示某些事件发生的概率，[25,25,25,10,15] 表示事件 A,B..E。这些数字加起来是 100。通过我的分析，我希望能够排除某个事件发生或不发生的可能性。所
google-maps - 免费地址验证/标准化
USPS webtools 很贵，而且 Google Maps 没有某些地址。有没有免费或开源的解决方案？最佳答案根据您的业务性质，或者如果您是非营利或教育机构，有一家在线提供商可为您提供 fre
javascript - 标准化 Javascript 对象
我有一个 json 对象，里面有对象例如 user: {"name": "tim"} 并希望有一种方法将其转换为 "user.name": 'tim' 我已经尝试过:Javascript Recurs
r - 标准化 R 中的数据列
我有一个名为 spam 的数据集，其中包含与垃圾邮件相关的 58 列和大约 3500 行数据。我计划将来对此数据集运行一些线性回归，但我想事先进行一些预处理并将列标准化为均值和单位方差为零。我被告
audio - 如何进行音频扩展/标准化(强调高低之间的差异)
我试图找到一种方法来强调音频中高点和低点之间的差异。我似乎找不到有关如何执行此操作的文档-也许可以使用ffmpeg完成。非常感谢来自对信号处理了解更多的人的一些指导。最佳答案从根本上讲，膨胀器与压
r - 标准化 R 中每行的数据
如何缩放/规范化每行数据(观察)？像 [-1:1] 这样的 z 分数？我看过之前的帖子，其中涉及整个数据集的标准化，如下所示 https://stats.stackexchange.com/ques
c# - 标准化 URI 以仅提取域名的最佳方法是什么？
例如: http://www.google.co.uk www.google.co.uk google.co.uk 将全部转换为: google.co.uk 我本来想使用 System.Uri 类，但
pandas - 标准化 Pandas 数据框中的一列
我可以使用此代码从 json 文件导入数据... import requests from pandas.io.json import json_normalize url = "https://da
string - 标准化 Prolog 原子中的空格字符
规范化 Prolog 原子中空白字符(空格、换行符、制表符)的最佳方法是什么，例如在 SWI-Prolog 中。IE。我想要一个规则: normalize_space_in_atom(+Atom1,
r - 标准化 R 中每行的数据
如何缩放/规范化每行数据(观察)？像 [-1:1] 这样的 z 分数？我看过之前的帖子，其中涉及整个数据集的标准化，如下所示 https://stats.stackexchange.com/ques
java - 标准化 UTC 日期
我正在尝试阅读代码片段，但它对我来说没有任何意义。请帮助我 /** * To make it easy to query for the exact date, we normalize all
nlp - 文本挖掘 - 最常用的词，标准化
我是一名研究人员，拥有大约 17,000 份自由文本文档，其中大约 30-40% 与我的结果相关。是否有一个开源工具可以用来确定与结果相关的最常见的单词(甚至短语，但不是必需的)，并对已经出现的单词的
python - 标准化 numpy 矩阵中的行
我正在尝试使用 L2 范数(单位长度)对 numpy 矩阵的行进行标准化。当我这样做时，我发现了一个问题。假设我的矩阵“b”如下: 现在，当我对第一行进行标准化时，如下所示，它工作正常。但是当我
python - 标准化 ndarray 的切片
我有一个 3 列数组。数组的第一列的值介于 1 和 10 之间。我需要提取第一列为 1 的所有行，并规范化该数组切片的第三列。然后对第一列等于 2 等的所有行重复相同的操作。如果我运行此代码，它会使
python - 标准化 Python 中的数据结构
如果我通过许多不同的文件/脚本使用这个结构当需要更改时，如何才能只更改一个地方，而不必在每个文件中更改它。 u = contents incomingUrl = urlparse(u).query o
c++ - 标准化 1MB 文本文件的最有效方法？
我有 1MB 的文本文件。我想删除空格、换行符、制表符，并以 4KB 迭代方式将 1MB 文件的字符大小写从小写转换为大写。我写了这段代码: for (i = 0, j= 0; i 首先，让我们定
parsing - 标准化 NFL 球队名称
这实际上是一个机器学习分类问题，但我想有一种非常好的快速而肮脏的方法来做到这一点。我想将描述 NFL 球队的字符串(例如“San Francisco”或“49ers”或“San Francisco 4
mysql - 标准化 : is it done good?
我正在创建游戏评论数据库。我对此很陌生，但我正在尽力。关于数据库的一点点:系统很简单，用户填写 php 表单，在其中插入他的姓名、电子邮件，然后选择反馈是好还是坏并留下评论/建议。我正在添加照片的视觉

首页

博学

6Ren·AI

商城

R标准化数据框中的数字变量，同时保留因子变量