gpt4 book ai didi

r - R中的数据字典打包

转载 作者:行者123 更新时间:2023-12-04 10:16:50 31 4
gpt4 key购买 nike

我正在考虑在 R 中编写一个数据字典函数,它以数据框为参数,将执行以下操作:

1)创建一个文本文件,其中:

一种。通过按类别列出变量数量、观察数量、完整观察数量等来总结数据框

湾对于每个变量,总结关于该变量的关键事实:均值、最小值、最大值、众数、缺失观测值的数量等

2) 创建一个 pdf,其中包含每个数字或整数变量的直方图和每个属性变量的条形图。

基本思想是用一个函数创建一个数据框的数据字典。

我的问题是:是否有一个包已经做到了这一点?如果没有,人们是否认为这将是一个有用的功能?
谢谢

最佳答案

有多种describe各种包中的功能。我最熟悉的是 Hmisc::describe。以下是其帮助页面的描述:

"该函数判断变量是否为字符型、因子型、类别型、二元型、离散型、连续型,并根据每种类型打印出简明的统计摘要。如果一个数值型变量有<= 10个唯一值,则认为它是离散型的。在此在这种情况下,不打印分位数。如果任何非二元变量的唯一值不超过 20 个,则会为其打印频率表。对于任何具有至少 20 个唯一值的变量,将打印 5 个最低值和最高值。”

以及输出示例:

Hmisc::describe(work2[, c("CHOLEST","HDL")])
work2[, c("CHOLEST", "HDL")]

2 Variables 5325006 Observations
----------------------------------------------------------------------------------
CHOLEST
n missing unique Mean .05 .10 .25 .50 .75 .90
4410307 914699 689 199.4 141 152 172 196 223 250
.95
268

lowest : 0 10 19 20 31, highest: 1102 1204 1213 1219 1234
----------------------------------------------------------------------------------
HDL
n missing unique Mean .05 .10 .25 .50 .75 .90
4410298 914708 258 54.2 32 36 43 52 63 75
.95
83

lowest : -11.0 0.0 0.2 1.0 2.0, highest: 241.0 243.0 248.0 272.0 275.0
----------------------------------------------------------------------------------

此外,关于获取直方图的观点,描述对象的 Hmisc::latex 方法将生成在上述输出中交错的直方图。 (您确实需要安装 LaTeX 函数才能利用这一点。)我很确定您可以在 Harrell 的网站或亚马逊的“Look Inside”演示文稿中找到输出的插图,他的书“Regression Modeling Strategies” ”。这本书有大量关于数据分析的有用 Material 。

关于r - R中的数据字典打包,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7695619/

31 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com