- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我已经找了很长一段时间了,但找不到一个简单的方法。我有一个仅由数值组成的 df,我想从我的 df 中创建一个汇总矩阵。
DF
V1 V2 V3 V4 V5 ...
x1 y1 z1 1 c1
x2 NA z2 0 c2
x3 y3 z3 1 NA
...
V4 最初是一个 TRUE/FALSE 变量,转换为通常应该起作用的数值变量。我想获得以下内容:
N Mean SD Min 1st Median 3rd Max
V1
V2
V3
V4
V5
...
具有 N、平均值、SD、最小值、第一、中值、第三、最大值的相应值。我尝试过简单的as.data.frame(summary(DF))
我尝试过 stargazer,但由于某种原因不起作用(我猜测是因为我有二元变量)
stargazer(DF, type= "html", nobs = TRUE, type="html", mean.sd = TRUE, median = TRUE, iqr = TRUE,
+ digits=2, align=T)
我读到了一些关于 qwraps2_summary_table 的内容。但他们似乎都给出了与我正在寻找的不同的 table “设计”。
我知道我也可以运行一个循环,例如:
for(i in (1:length(DF)){
sum$N<-(????)
sum$Mean<-mean(DF[i])
....}
但这不是最好的解决方案。有什么建议吗?谢谢!
这是我的数据集的一部分
structure(list(Year = c(2011, 2012, 2013, 2014, 2015, 2016, 2017,
2018, 2018, 2011), Occurences = c(9L, 9L, 9L, 9L, 9L, 9L, 9L,
9L, 2L, 9L), Balance = c(-1.14, 1.05, -1.06, 1.01, 1.01, 1.01,
-1.09, -1, -1.04, -1.03), Withdrawal = c(43200, 41080, 43400,
43183, 42600, 42100, 45900, 46000, 3892008, 48374), Verification_SA = c(NA,
NA, NA, NA, 1, 1, NA, 1, 1, NA), Classification_num = c(NA, NA,
NA, NA, 3, 2, NA, 4, 4, NA), Interaction_Verification_Classification = c(NA,
NA, NA, NA, 3, 2, NA, 4, 4, NA), KnowledgeSources = c(1, 1, 1,
0, 1, 1, 1, 1, 1, 0), KnowledgeDischarge = c(0, 0, 0, 0, 0, 1,
1, 1, 1, 0), Scarcity_watershed = c(NA_real_, NA_real_, NA_real_,
NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_
), Scarcity_country = c(NA, NA, NA, NA, NA, NA, NA, NA, 3.35,
NA), Knowledge_Watershed = c(0, 0, 0, 0, 0, 0, 0, 0, 0, 0), Knowledge_Facilities = c(0,
0, 0, 0, 0, 0, 0, 0, 1, 1), Importance_num = c(NA, NA, NA, 3,
3, 3, 3, 3, 5, NA), DetrimentalImpacts_num = c(0, 0, 1, 0, 0,
0, 0, 0, 0, 0), Responsibility_num = c(1, 1, 1, 2, 2, 2, 2, 3,
3, 1)), row.names = c(NA, -10L), class = c("tbl_df", "tbl", "data.frame"
))
最佳答案
以 Ian Campbell 的答案为基础,我们不应该害怕在需要时构建一个汇总函数。
summaryfn <- function(x){
c(min(x),
quantile(x,0.25,na.rm=TRUE),
quantile(x,0.5,na.rm=TRUE),
mean(x,na.rm=TRUE),
sd(x, na.rm=TRUE),
quantile(x,0.75,na.rm=TRUE),
max(x,na.rm=TRUE),
sum(is.na(x)))
}
res <- do.call(rbind,lapply(df,summaryfn))
colnames(res) <- c("Min","Q1","Med","Mean","Sd","Q3","Max","NAs")
## > res
## Min Q1 Med Mean Sd Q3 Max NAs
## Year 2011.00 2012.250 2014.500 2014.500000 2.718251e+00 2016.75 2018.00 0
## Occurences 2.00 9.000 9.000 8.300000 2.213594e+00 9.00 9.00 0
## Balance -1.14 -1.055 -1.015 -0.228000 1.074800e+00 1.01 1.05 0
## Withdrawal 41080.00 42745.750 43300.000 428784.500000 1.216855e+06 45975.00 3892008.00 0
## Verification_SA NA 1.000 1.000 1.000000 0.000000e+00 1.00 1.00 6
## Classification_num NA 2.750 3.500 3.250000 9.574271e-01 4.00 4.00 6
## Interaction_Verification_Classification NA 2.750 3.500 3.250000 9.574271e-01 4.00 4.00 6
## KnowledgeSources 0.00 1.000 1.000 0.800000 4.216370e-01 1.00 1.00 0
## KnowledgeDischarge 0.00 0.000 0.000 0.400000 5.163978e-01 1.00 1.00 0
## Scarcity_watershed NA NA NA NaN NA NA -Inf 10
## Scarcity_country NA 3.350 3.350 3.350000 NA 3.35 3.35 9
## Knowledge_Watershed 0.00 0.000 0.000 0.000000 0.000000e+00 0.00 0.00 0
## Knowledge_Facilities 0.00 0.000 0.000 0.200000 4.216370e-01 0.00 1.00 0
## Importance_num NA 3.000 3.000 3.333333 8.164966e-01 3.00 5.00 4
## DetrimentalImpacts_num 0.00 0.000 0.000 0.100000 3.162278e-01 0.00 1.00 0
## Responsibility_num 1.00 1.000 2.000 1.800000 7.888106e-01 2.00 3.00 0
## > str(res)
## num [1:16, 1:8] 2011 2 -1.14 41080 NA ...
## - attr(*, "dimnames")=List of 2
## ..$ : chr [1:16] "Year" "Occurences" "Balance" "Withdrawal" ...
## ..$ : chr [1:8] "Min" "Q1" "Med" "Mean" ...
虽然在很多情况下 stargazer
是一个不错的选择,但我会推荐 xtable
因为它的灵活性。
print(xtable(res),type="html")
关于r - DF 作为矩阵的总结,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/61129156/
努力理解标题中 5 个示例之间的区别。系列与数据框有一些用例吗?什么时候应该使用一个而不是另一个?哪些是等价的? 最佳答案 df[x] — 使用变量 x 索引列。返回 pd.Series df[[x]
在使用Jupyter Notebook时,我必须为问题标题中提到的df.info()、df.head()等单独留出空格. 有没有办法像第二张图片那样把所有这些都放在一个 block 中,并显示所有信息
我想求三列之和,我采取的方法如下: In [14]: a_pd = pd.DataFrame({'a': np.arange(3), 'b': [5, 7,
我想我们大多数人已经使用过这样的东西(至少如果你正在使用 tidyverse): library(tidyverse) example % select(- mpg) 我的问题: 我知道这部分有一
我有一个 DF,里面有大约 20,000 行。我构建了一个 Python 脚本来对这些数据(包括数据透视表)运行大量清理和数学运算。 我想将此 DF 拆分为 3 个独立的 DF,然后根据列值将这 3
我什至不知道如何表达这一点,但在 Python 中有没有一种方法可以引用等号之前的文本,而无需实际再次编写? ** 编辑 - 我在 Jupyter 中使用 python3 我似乎用了半辈子的时间来写作
在 df1 中,每个单元格值都是我想要从 df2 中获取的行的索引。 我想获取 df2 trial_ms 列中行的信息,然后根据获取的 df2 列重命名 df1 中的列。 可重现的 DF: # df1
我想转换此表 0 thg John 3.0 1 thg James 4.0 2 mol NaN 5.0 3 mol NaN NaN 4
我有一个数据框,我想从中提取 val 中的值大于 15 以及 val 不是 NA: df[ !is.na(df$val) & df$val > 15, ] 由于我假设在 R 中经常需要这样的比较,所
鉴于 coming deprecation of df.ix[...] 如何替换这段代码中的 .ix? df_1 = df.ix[:, :datetime.time(16, 50)] d
任何我可以帮助我说出 Pandas 中这两个语句之间的区别-python df.where(df['colname'] == value) 和 df[(df['colname'] == value)]
考虑 df Index A B C 0 20161001 0 24.5 1 20161001 3 26.5 2
所以我需要按“fh_status”列对行进行分组,然后对每个组执行“gini”的最小值、平均值和最大值(将有三个)。我想出了这段代码: m = (df2.groupby(['fh_status']).
我尝试计算不同公司/股票的一些 KPI。我的股票信息位于 df 中,具有以下结构 Ticker Open High Low Ad
我有一个看起来像这样的 df: gene ID Probe ID Chromosome Start Stop 1: H3F3A 539154271
nn_idx_df 包含与 xyz_df 的索引匹配的索引值。如何从 xyz_df 中的 H 列获取值并在 nn_idx_df 中创建新列以匹配 output_df 中所示的结果。我可以解决这个问题,
我目前的 DF 看起来像这样 Combinations Count 1 ('IDLY', 'VADA') 3734 6 ('DOSA', 'IDLY')
我看到了几个与此相关的问题,但我发现这些技巧都不起作用。 我正在尝试根据第二个数据帧的值填充数据帧的所有 NaN 值。第一个 df 很大,第二个 df 将充当某种键。 DF1 Par
我有两个数据帧,df1 和 df2。每个数据帧的唯一标识符是“ID”和“Prop_Number”。我需要将 df1 中的 Num1、2 和 3 列复制到 df2、1_Num 中的相应列...但我不确定
我有以下数据框: 注意:日期是索引 city morning afternoon evening midnight date 2014-05-01 Y
我是一名优秀的程序员,十分优秀!