- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我有不完整的(时间)系列,我想使用其他系列(国家/地区)的可用近期值和增长率来填补缺失值。类别、缺失值不等长。这需要按顺序对变量应用一个函数:首先我需要获取最后一个可用数据点(可以是任何地方)并将其除以 1+ 增长率,然后移动到下一个数据点并执行相同的操作。
示例数据集和期望的结果:
require(data.table)
DT_desired<-data.table(category=c(rep("A",4),rep("B",4)),
year=2010:2013,
grwth=c(NA,.05,0.1,0,NA,0.1,0.15,0.2))
DT_desired[,values:=c(cumprod(c(1,DT_desired[category=="A"&!is.na(grwth),grwth]+1)),cumprod(c(1,DT_desired[category=="B"&!is.na(grwth),grwth]+1)))]
DT_example <- copy(DT_desired)[c(1,2,3,5),values:=NA]
我尝试了什么:您可以通过 for 循环来完成,但在 R 中这样做效率低下且不受欢迎。我开始喜欢 data.table 的效率,我更愿意以这种方式进行。我试过数据表的移位功能,它只填充一个缺失值(这是合乎逻辑的,因为它试图同时执行我猜,当其余的缺失前一个值时)。
DT_example[,values:=ifelse(is.na(values),shift(values,type = "lead")/(1+shift(grwth,type = "lead")),values),by=category]
我从其他帖子了解到,您可能可以使用 zoo 包的 rollapply 函数来完成它,但我只是觉得我应该能够在数据表中完成它而无需另一个额外的包,并且解决方案比较简洁大方,只是我经验不够,找不到。
这很可能是重复的,很抱歉,如果我没有注意到合适的帖子,但我发现的都不是我想要的。
最佳答案
不确定这是否已在 SO 之外解决,但前几天引起了我的注意。我已经很长时间没有编写 Rcpp 了,我认为这是一个很好的实践。我知道您正在寻找原生的 data.table
解决方案,所以请随意选择或保留它:
foo.cpp
文件的内容:
#include <Rcpp.h>
using namespace Rcpp;
// [[Rcpp::export]]
NumericVector fillValues(NumericVector vals, NumericVector gRates){
int n = vals.size();
NumericVector out(n);
double currentValue = vals[n - 1];
double currentGrowth = gRates[n - 1];
// initial assignment
out[n - 1] = currentValue;
for(int i = n - 2; i >= 0; i--){
if(NumericVector::is_na(vals[i])){
// If val[i] is na, we need prior values to populate it
if(!((currentValue || currentValue == 0) && (currentGrowth || currentGrowth == 0))){
// We need a currentValue and currentGrowth to base growth rate on, throw error
Rcpp::stop("NaN Values for rates or value when needed actual value");
} else {
// Update value
out[i] = currentValue / (1 + currentGrowth);
}
} else {
out[i] = vals[i];
}
// update
currentValue = out[i];
if(!NumericVector::is_na(gRates[i])){
currentGrowth = gRates[i];
}
}
return out;
}
/*** R
require(data.table)
DT_desired<-data.table(category=c(rep("A",4),rep("B",4)),
year=2010:2013,
grwth=c(NA,.05,0.1,0,NA,0.1,0.15,0.2))
DT_desired[,values:=c(cumprod(c(1,DT_desired[category=="A"&!is.na(grwth),grwth]+1)),cumprod(c(1,DT_desired[category=="B"&!is.na(grwth),grwth]+1)))]
DT_example <- copy(DT_desired)[c(1,2,3,5),values:=NA]
DT_desired[]
DT_example[]
DT_example[, values:= fillValues(values, grwth)][]
*/
然后运行它:
> Rcpp::sourceCpp('foo.cpp')
# Removed output that created example data
> DT_desired[]
category year grwth values
1: A 2010 NA 1.000
2: A 2011 0.05 1.050
3: A 2012 0.10 1.155
4: A 2013 0.00 1.155
5: B 2010 NA 1.000
6: B 2011 0.10 1.100
7: B 2012 0.15 1.265
8: B 2013 0.20 1.518
> DT_example[]
category year grwth values
1: A 2010 NA NA
2: A 2011 0.05 NA
3: A 2012 0.10 NA
4: A 2013 0.00 1.155
5: B 2010 NA NA
6: B 2011 0.10 1.100
7: B 2012 0.15 1.265
8: B 2013 0.20 1.518
> DT_example[, values:= fillValues(values, grwth)][]
category year grwth values
1: A 2010 NA 1.000
2: A 2011 0.05 1.050
3: A 2012 0.10 1.155
4: A 2013 0.00 1.155
5: B 2010 NA 1.000
6: B 2011 0.10 1.100
7: B 2012 0.15 1.265
8: B 2013 0.20 1.518
请注意,这是从后往前运行的,因此它假设您要从最近的记录开始,然后从更远的地方开始记录。它还假定您的数据集已排序。
关于r - 使用类别增长率填充 data.table 中的缺失值,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53502568/
关闭。这个问题是opinion-based .它目前不接受答案。 想改善这个问题吗?更新问题,以便可以通过 editing this post 用事实和引文回答问题. 9 个月前关闭。 Improve
我使用 partykit打包并遇到以下错误消息: Error in matrix(0, nrow = mi, ncol = nl) : invalid 'nrow' value (too large
我一直在尝试寻找一个量表或分类指标,为 VADER 情绪分析分配一些情感程度,而不仅仅是积极、消极或中性。如果有人可以分享他们的观点或资源来帮助按以下方式对 VADER 复合分数进行分类,我将非常感激
伙计们,我想自动循环..但我不知道是我放错了 while 还是循环错了? 我的数据库 标签:kt_barang kd_kategori | nama_kategori 1
我正在创建一个列出本地企业并按类别、子类别和关键字对它们进行分组的应用程序。以下是企业排序规则: 一个企业可以属于多个类别和子类别 一个企业可以有多个关键字 并非每个类别都有子类别,但有子类别的只有两
我有一系列单词 - 我的刺激 - 它们显示在屏幕上。然而,每个词都有另一个“条件”,即它们是类别 A、类别 B 或类别 C。这可能很简单,但我找不到答案并坚持下去。我的最终目标是在每次运行脚本时将类别
我正在使用 Laravel 5.5 和 MySql。如果不向 Services 表中添加 subCategoryID 列,我无法弄清楚如何将类别和子类别与服务相关联。 目前这是我的表结构 服务类别 i
我有两个部分/类别结构的链接表。 the section table structure id sec_title 1 section 1 2 section 2 the category str
我有一个类层次结构如下 @interface PTLDatasource : NSObject ... @interface PTLFetchedDatasource : PTLDatasource
我有一个 DataFrame df 一列,category 使用以下代码创建: import pandas as pd import random as rand from string import
我经常在多个类中设置获取请求以从核心数据(加上一些其他结果)中检索“allRecipes”或“lastModifiedDate”。 为此使用专门的类别 NSManagedObjectContext+R
可以在 Objective C 中创建类别之间的依赖关系吗?也在类别和它们的基类之间? 我知道在运行时应该没有区别,它们可能只是在编译时合并在一起。例如,假设我将 B 类分解为: B(base cla
这个问题在这里已经有了答案: 关闭 10 年前。
example img of a category selection by user 嘿,我正在尝试设置一个选择,用户必须选择一个类别和第二个类别,但我不知道如何获取他单击的信息。用户单击类别后,它
尝试将投资组合库添加到我正在制作的自定义 wp 主题中。我已经筋疲力尽地试图寻找甚至可以修改一些的解决方案和插件。我认为我在寻找解决方案时遇到的一个问题是我不完全确定哪些搜索词可以帮助我找到与我想要实
当我查看 Cocoa Touch API 时,我可以在同一个头文件中找到一些与类别一起声明的类,例如 @interface NSArray : NSObject @property (readonl
我的 log4j.properties 中有以下内容 log4j.rootLogger = debug, stdout, fileLog log4j.appender.stdout = org.apa
如果我在类中添加类别方法,比如NSXMLNode: @interface NSXMLNode (mycat) - (void)myFunc; @end NSXMLNode 的子类,例如 NSXMLEl
先说场景,wordpress的分类结构是这样的 Level 1: Top Level 2: -Nextme_1 Level 3: --Nextme_2 --Nextme_3 Leve
我有一个解析网络,现在我想浏览标签,或显示图表。我怎样才能得到图表?或者在树中导航。显示第一步然后其他等。并了解这棵树是如何 build 的。 import urllib from lxml impo
我是一名优秀的程序员,十分优秀!