- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
考虑以下数据框,
import pandas as pd
import numpy as np
np.random.seed(666)
dd=pd.DataFrame({'v1': np.random.choice(range(30), 20),
'v2': np.random.choice(pd.date_range(
'5/3/2016', periods=365, freq='D'),
20, replace=False)
})
dd=dd.sort_values('v2')
# v1 v2
#5 4 2016-05-03
#11 14 2016-05-26
#19 12 2016-06-26
#15 8 2016-07-06
#7 27 2016-08-04
#4 9 2016-08-28
#17 5 2016-09-08
#13 16 2016-10-04
#14 14 2016-10-10
#18 18 2016-11-25
#3 6 2016-12-03
#8 19 2016-12-04
#12 1 2016-12-12
#10 28 2017-01-14
#1 2 2017-02-12
#0 12 2017-02-15
#9 28 2017-03-11
#6 29 2017-03-18
#16 7 2017-03-21
#2 13 2017-04-29
我想创建基于以下两个条件的组:
v1 <= 40
的累计总和v2 <= 61
的时差天换句话说,每个组的总和必须是 40 v1
或2个月的时间。因此,如果 61 天过去了,但 40 天还没有完成,那么无论如何都要关闭该组。如果 40 在 1 天内完成,再次关闭该组
最后的标志是,
dd['expected_flag']=[1, 1, 1, 2, 2, 3, 3, 3, 4, 4, 4, 5, 5, 6, 6, 7, 7, 8, 8, 9]
我在 R here 中问过一个非常相似的问题但是现在(日期)有一个新的要求,我无法完全理解它。
注意我将在庞大的数据集中运行它,因此效率越高越好
编辑:我找到了this question它基本上处理第一个条件而不是日期条件
编辑 2:61 天的时差只是为了表示时间限制。实际上,这种限制将在几分钟内完成
编辑 3:使用@Maarten 提供的函数,我得到以下(前 40 行),其中第 1 组还应包括第 2 组的前 2 个(即 v1=6 和 v1 =6).
Out[330]:
index v2 v1 max_limit group
0 2 2017-04-01 00:00:02 14 335.0 1
1 3 2017-04-01 00:00:03 8 335.0 1
2 13 2017-04-01 00:00:13 11 335.0 1
3 14 2017-04-01 00:00:14 11 335.0 1
4 29 2017-04-01 00:00:29 4 335.0 1
5 44 2017-04-01 00:00:44 16 335.0 1
6 52 2017-04-01 00:00:52 10 335.0 1
7 58 2017-04-01 00:00:58 11 335.0 1
8 65 2017-04-01 00:01:05 15 335.0 1
9 68 2017-04-01 00:01:08 8 335.0 1
10 81 2017-04-01 00:01:21 12 335.0 1
11 98 2017-04-01 00:01:38 9 335.0 1
12 102 2017-04-01 00:01:42 7 335.0 1
13 107 2017-04-01 00:01:47 12 335.0 1
14 113 2017-04-01 00:01:53 6 335.0 1
15 116 2017-04-01 00:01:56 6 335.0 1
16 121 2017-04-01 00:02:01 4 335.0 1
17 128 2017-04-01 00:02:08 16 335.0 1
18 143 2017-04-01 00:02:23 7 335.0 1
19 149 2017-04-01 00:02:29 11 335.0 1
20 163 2017-04-01 00:02:43 4 335.0 1
21 185 2017-04-01 00:03:05 9 335.0 1
22 239 2017-04-01 00:03:59 6 335.0 1
23 242 2017-04-01 00:04:02 13 335.0 1
24 272 2017-04-01 00:04:32 4 335.0 1
25 293 2017-04-01 00:04:53 8 335.0 1
26 301 2017-04-01 00:05:01 10 335.0 1
27 302 2017-04-01 00:05:02 7 335.0 1
28 305 2017-04-01 00:05:05 12 335.0 1
29 323 2017-04-01 00:05:23 5 335.0 1
30 326 2017-04-01 00:05:26 13 335.0 1
31 329 2017-04-01 00:05:29 10 335.0 1
32 365 2017-04-01 00:06:05 10 335.0 1
33 368 2017-04-01 00:06:08 11 335.0 1
34 411 2017-04-01 00:06:51 6 335.0 2
35 439 2017-04-01 00:07:19 6 335.0 2
36 440 2017-04-01 00:07:20 8 335.0 2
37 466 2017-04-01 00:07:46 7 335.0 2
38 475 2017-04-01 00:07:55 4 335.0 2
39 489 2017-04-01 00:08:09 4 335.0 2
所以为了清楚起见,当我求和并计算我得到的时间差时,
dd.groupby('group', as_index=False).agg({'v1': 'sum', 'v2': lambda x: max(x)-min(x)})
Out[332]:
# group v1 v2
#0 1 320 00:06:06
#1 2 326 00:07:34
#2 3 330 00:06:53
#...
最佳答案
设置:
dd['days'] = dd['v2'].diff().dt.days.fillna(0).astype(int)
dd = dd[['v1', 'v2', 'days']] # the order of the columns matters
初始化:
increment = pd.Series(False, index=dd.index)
v1_cum = 0
days_cum = 0
循环:
for row in dd.itertuples(name=None): # faster than iterrows
v1_cum += row[1]
days_cum += row[3]
if v1_cum > 40 or days_cum > 61:
increment[row[0]] = True # first element of tuple is index
# notice the different re-initialization
v1_cum = row[1]
days_cum = 0
分配:
dd['flag'] = increment.cumsum() + 1
输出:
[1, 1, 1, 2, 2, 3, 3, 3, 4, 4, 4, 5, 5, 6, 6, 7, 7, 8, 8, 9]
关于python - 基于 cumsum 和 timediff 创建标志,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/46096801/
我有两个维度 DimFlag 和 DimPNL 以及一个事实表 FactAmount 。我正在寻找:当 pnl 是 stat(Is Stat=1) 时:sum (Actual x FlagId)对于
我试图弄清楚登录模块标志在 JAAS 中是如何工作的(使用 JBoss 5.1 EAP),我遇到了一个令人费解的情况,我希望有人能为我澄清一下。 对于背景,我的 login-config.xml 如下
关闭。这个问题是off-topic .它目前不接受答案。 想改进这个问题吗? Update the question所以它是on-topic用于堆栈溢出。 关闭 9 年前。 Improve this
我正在通过 gradle 使用 doclet 运行 javadoc,当我运行 javadoc/doclet 任务时,我收到下一个错误: error - invalid flag: -doctitle
我尝试使用sqoop --where标志将特定的行从MySQL表导入到HDFS,但是结果不符合预期。 命令: sqoop import \ --connect "jdbc:mysql://XXXX
我有一个语言面板,其中有一个图像 (main-image),显示页面加载时的情况。我还有三个额外的图像,它们在页面加载时隐藏。 问题是当点击附加图像之一时如何切换主图像。我需要使用单击的 image
奇怪...在 StackOverflow 上有很多关于此 attr 的问题,但没有人回答我的以下问题: 我有一个span(仅作为示例),其中启用了ContentEditable。我只想保存更改的元素(
我正在使用 ChartJS 2.0 在 UI 上绘制图表。而且我能够呈现饼图。但我希望鼠标悬停时显示数据以及“%”符号。我如何追加 % 因此,如果在鼠标悬停时我得到 Rented: 93 我想看到 R
我使用的是 Servlet 3.0,我想用 HttpOnly 标志保护我的 cookie。我的 web.xml 是 true
我有一个简单的服务: public class TestService extends Service { final String LOG_TAG = "myLogs"; public void o
我正在尝试将 wget 与包含“#”符号的 url 一起使用。无论我做什么来逃避这个角色,它都不起作用。我用过\、' 和 "。但它们都不起作用。有人有什么建议吗? 谢谢! 最佳答案 如果您真的想让它有
我正在尝试创建一个数据库,但我不知道如何转义数据库名称中的 - 符号。 mysql> create database happy-face; 给我一个错误 mysql> create databa
我为我的计算机科学类(class)编写了一个程序,它读取一个文件并导入数据,然后只添加数字,但它似乎添加了一个额外的加号。 import java.io.*; //necessary for File
可能是个愚蠢的问题,但我怎样才能在与某些文本看到图像相同的行中获取图像(在本例中为标志)? 到目前为止我的 HTML 代码: FRA 最佳答案 试试这个: img { height:20px
我需要一些有关 clone() 系统调用的帮助。我试图将它与标志 CLONE_CHILD_CLEARTID 一起使用,但我看不到我指定为参数的字段值有任何变化。这是一个简单的代码: int the_c
查看 mySQL 转储时,我遇到了一些东西,想知道它们是什么。 我明白了: /*!50001 DROP TABLE IF EXISTS `xxx` */; flag 50001是什么意思,有什么意思的
是否可以传递任何 Java 编译器标志来告诉编译器不允许使用原始类型?也就是说,对于任何泛型类,让编译器强制使用参数化版本,否则抛出编译错误? 最佳答案 JDK7 (b38) 介绍 -Xlint:ra
[Flags] public enum MyEnum { None = 0, Setting1 = (1 GetAllEnums() where T : struct
我正在浏览 PackageManager API。我发现定义了以下常量: 1) GET_DISABLED_COMPONENTS 2) GET_DISABLED_UNTIL_USED_COMPONENT
我编写了一个 Go 程序来模拟按键操作。为此,我必须使用 cgo 和不同的 C 代码片段,具体取决于正在编译 Go 代码的操作系统。我编写的代码如下所示: package keyboard /* #i
我是一名优秀的程序员,十分优秀!