- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在努力寻找使用某些约束对 DataFrame 进行分组的正确方法。我有以下数据框:
start_dt machine benchmark value1 value2 value3
2021-06-07 07:32:01 A bench1 0 0 0
2021-06-07 07:32:37 A bench1 0 0 0
2021-06-07 07:33:13 A bench1 0 0 0
2021-06-07 07:33:49 A bench1 0 0 0
2021-06-07 07:34:26 A bench1 0 0 0
2021-06-07 08:30:26 A bench1 0 0 10
2021-06-07 11:12:21 A bench1 0 0 6
2021-06-07 12:05:21 A bench1 1 0 10
2021-06-17 12:28:57 A bench2 0 0 0
2021-06-17 12:29:29 A bench2 0 0 0
2021-06-17 12:33:09 A bench2 3 0 1
2021-06-17 12:33:48 A bench2 3 0 1
2021-06-17 12:35:17 A bench2 0 0 0
我想根据机器、基准和 start_dt 列进行分组。但是,它对 start_dt 列有一些限制。start_dt 组标准必须位于 1h block 上。我尝试了以下命令:
df.groupby(["machine", "benchmark", pd.Grouper(key="start_dt", freq="1h", sort=True, origin="start")]).sum()
但是,它会根据所有基准测试的第一个日期时间对数据帧进行分组,我不希望这样。我想要的是类似下面的内容,其中 end_dt 是 start_dt + 1h。
machine benchmark start_dt end_dt value1 value2 value3
A bench1 2021-06-07 07:32:01 2021-06-07 08:32:01 0 0 10
2021-06-07 11:12:21 2021-06-07 12:12:21 1 0 16
bench2 2021-06-17 12:28:57 2021-06-17 13:28:57 6 0 2
例如机器A和benchmark bench1至少有两个时间间隔
2021-06-07 07:32:01 2021-06-07 08:32:01
2021-06-07 11:12:21 2021-06-07 12:12:21
但中间没有任何内容,因此我想保持时间间隔,因为它们出现在列上,而不是 pandas Grouper 给我的时间间隔。可能吗?
编辑:
最佳答案
是的,这是可能的,您只需要创建一个自定义分组函数来处理用例的不一致性。在下面的解决方案中,我首先创建一个新列 end_dt
,稍后我们将其用作最内层的分组索引。为了创建这个列,我们正在调用函数 get_end_times()
使用 start_dt
列,该列将获取每个组 (machine
/benchmark
组合)并调用 run_calc()
内部函数。此函数使用传递给函数的数据帧切片中的第一个 start_dt
来确定设置端点的位置(1 小时后)。然后它检查哪些元素落在该范围内并返回 end_dt
的集合,该集合将被重新分配给调用内部函数的组。这将迭代,直到所有 start_dt
值都被分配了一个 end_dt
值(通过 (~f).all()
检查)。完整实现见下文:
def run_calc(x):
i = (x - x.iloc[0]).dt.total_seconds()>3600
x[~i] = x.iloc[0] + np.timedelta64(1, 'h')
return x, i
def get_end_times(group):
f = pd.Series([True]*len(group), index=group.index)
iterate = True
while iterate:
new, f = run_calc(group[f])
group[(~f).index] = new
if (~f).all(): iterate = False
return group
df['end_dt'] = df.groupby(['machine','benchmark'])['start_dt'].transform(get_end_times)
df.groupby(['machine','benchmark','end_dt']).agg({'start_dt': 'first', 'value1': 'sum', 'value2': 'sum', 'value3': 'sum'}) \
.reset_index().set_index(['machine','benchmark','start_dt','end_dt'])
产量:
value1 value2 \
machine benchmark start_dt end_dt
A bench1 2021-06-07 07:32:01 2021-06-07 08:32:01 0 0
2021-06-07 11:12:21 2021-06-07 12:12:21 1 0
bench2 2021-06-17 12:28:57 2021-06-17 13:28:57 6 0
value3
machine benchmark start_dt end_dt
A bench1 2021-06-07 07:32:01 2021-06-07 08:32:01 10
2021-06-07 11:12:21 2021-06-07 12:12:21 16
bench2 2021-06-17 12:28:57 2021-06-17 13:28:57 2
关于python - Pandas groupby 可变时间间隔,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/68154495/
我试图根据表格看起来像这样的状态代码来查找表格中的空白。 状态表: StateID (PK) | Code -------------------- 1 | AK 2
我有一个配对字符串列表。我想找到两个字母之间的长度/间隔。到目前为止,我可以使用找到有序字母的间隔 alpha =["AM", "KQ", "ZN", "XM", "UK"] leng
我有一个配对字符串列表。我想找到两个字母之间的长度/间隔。到目前为止,我可以使用找到有序字母的间隔 alpha =["AM", "KQ", "ZN", "XM", "UK"] leng
我正在努力弄清楚如何将时间选择器的下拉间隔设置为 15 分钟间隔。默认为 30 分钟 atm。让它工作的正确调用/符号是什么?我已经尝试了很多将它们放入 '' 的变体,但没有任何进展。谢谢! $
假设我有 table teach_subject(teacher_id, subject_id, min_grade_of_school, max_grade_of_school, color_in_
我有下面的图像,我试图以 3 秒的间隔一张一张地显示它们,但我无法让它工作。它继续停留在 0 并且不显示图像,帮助会很好: JavaScript: window.animate = functio
我认为这个问题类似于加权间隔调度问题,但略有不同。 假设您有一个具有开始时间和结束时间的类次 s,该类次从 s.start 开始有 n 个空位到s.end。时隙是从 s.start 到 s.end 的
我试图将一个 GeometryReader 作为按钮推到屏幕底部,但 Spacer 在这里不起作用...... 这个想法是让应用程序响应所有屏幕尺寸。 VStack { GeometryRea
我问了一个相关问题 here但意识到我在计算这个复杂的度量时花费了太多时间(目标是与随机化测试一起使用,所以速度是一个问题)。所以我决定放弃权重,只使用两个度量之间的最小距离。所以这里我有 2 个向量
我最近成立 healthcheck s 在我的 docker-compose配置。 它做得很好,我喜欢它。下面是一个典型的例子: services: app: healthcheck:
我正在 Cocoa 中使用如下设置的 NSTimer 运行 mainLoop: mainLoopTimer = [NSTimer scheduledTimerWithTimeInter
目前正在开发家庭自动化应用程序,其中有事件 API 可以在事件被触发时为我提供事件。但我想持续运行 API,以便跟踪在整个应用程序中触发的事件。还有一个主页,我在其中显示曾经发生的事件。它是一个简单的
我有一个查询应该是这样的要求: { "size": 0, "_source": [ "dateCreated" ], "query": { "bool": {
我有一个 UNIX 格式的时间字符串。我需要将该字符串四舍五入到最接近的 30 分钟间隔。 例如:我的时间是上午 9:20,而不是应该四舍五入到上午 9:30。 如果分钟数大于 30,例如上午 9:4
我有网络调用,我想定期调用它。我只想将运算符 Interval 与 flatMap 一起使用,但在间隔线程上。你能解释一下这种情况吗?我知道Interval只使用一个线程,任务是按顺序处理的。 我有
我在我的 iOS 应用程序中使用了 NSTimer,但由于 SetNeedsDisplay,我没有得到我想要的结果。 我做了一些研究并找到了 CADisplayLink,它为我提供了我想要的动画结果。
我需要通过给出值数组来生成 map 上图例的值。Java 库中是否有函数可以从值数组和计数值生成范围或区间?像这样的东西: Integer[] getIntervals(Number[] values
我的函数中有以下代码,我试图从数据库中获取参数MAX_FAILED_ATTEMPT,并且基于此,如果检查失败,我将发送警报。当前代码将尝试从 MAX_FIELD_ATTEMPT 获取值并立即依次进行检
我在这里要做的是像 Windows XP 上的那样放下一个轨迹栏来更改分辨率:( http://puu.sh/7Li5h.png ) 我想设置特定的间隔/增量值,如上图所示。目前,实际栏下方的线条已经
是否可以停止当前作为 setInterval 运行的函数? 这是我的代码: 这是我调用的函数 function pull_light_status (lights_array) { $.get
我是一名优秀的程序员,十分优秀!