- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在 Pyspark 上处理数据框。一列由时间对应的整数值组成:
data.select('TIME').show(4)
+------------------+
|TIME |
+------------------+
| 925|
| 2205|
| 2205|
| 2205|
+------------------+
我想将这个时间四舍五入到最接近的值,时间步长为 15 分钟,以获得:
+------------------+
|TIME_15_MIN_STEP |
+------------------+
| 930|
| 2200|
| 2200|
| 2200|
+------------------+
有人知道怎么做吗?
非常感谢!!
最佳答案
不使用 udf
的一种方法是首先将整数列转换为虚拟时间戳,然后执行与 my answer 中概述的几乎相同的操作。到 similar question .最后将结果转换回所需格式的整数。
更详尽的示例数据
我创建了一个具有更多可变性的示例来证明此方法正常工作。
data = sqlCtx.createDataFrame([(925,), (2205,), (2210,), (2242,), (2255,)], ["TIME"])
data.show()
#+----+
#|TIME|
#+----+
#| 925|
#|2205|
#|2210|
#|2242|
#|2255|
#+----+
将整数列转换为虚拟时间戳
要将整数小时-分钟列转换为时间戳,我们首先使用 pyspark.sql.functions.format_string()
至 add leading zeros到合适的时候。接下来,我们将一个虚拟日期(我使用了 "2018-01-01"
)与转换后的时间连接起来,并在末尾添加 ":00"
(表示秒)。
data = data.withColumn("time_string", f.format_string("%04d", f.col("TIME")))\
.withColumn(
"time_string",
f.concat_ws(
":",
f.array(
[
f.substring(
"time_string",
1,
2
),
f.substring(
"time_string",
3,
2
),
f.lit("00")
]
)
)
)\
.withColumn("time_string", f.concat(f.lit("2018-01-01 "), f.col("time_string")))
data.show()
#+----+-------------------+
#|TIME| time_string|
#+----+-------------------+
#| 925|2018-01-01 09:25:00|
#|2205|2018-01-01 22:05:00|
#|2210|2018-01-01 22:10:00|
#|2242|2018-01-01 22:42:00|
#|2255|2018-01-01 22:55:00|
#+----+-------------------+
计算偏移时间戳的分钟数
使用pyspark.sql.functions.minute()
从虚拟时间戳中获取分钟。我们除以 15,四舍五入,然后乘以 15 得到"new"分钟。 (此逻辑在 linked answer 中有更详细的解释。)
data = data.withColumn("minute", f.minute("time_string"))\
.withColumn("new_minute", f.round(f.col("minute")/15)*15)\
.withColumn("minute_add", f.col("new_minute") - f.col("minute"))\
data.show()
#+----+-------------------+------+----------+----------+
#|TIME| time_string|minute|new_minute|minute_add|
#+----+-------------------+------+----------+----------+
#| 925|2018-01-01 09:25:00| 25| 30.0| 5.0|
#|2205|2018-01-01 22:05:00| 5| 0.0| -5.0|
#|2210|2018-01-01 22:10:00| 10| 15.0| 5.0|
#|2242|2018-01-01 22:42:00| 42| 45.0| 3.0|
#|2255|2018-01-01 22:55:00| 55| 60.0| 5.0|
#+----+-------------------+------+----------+----------+
以秒为单位添加偏移量,转换回整数
将 minute_add
列乘以 60 以获得以秒为单位的偏移量。将此添加到 time_string
以获得"new"时间。
data = data.withColumn(
"new_time",
f.from_unixtime(f.unix_timestamp("time_string") + f.col("minute_add")*60)
)\
.withColumn(
"NEW_TIME",
f.format_string("%02d%02d", f.hour("new_time"), f.minute("new_time")).cast("int")
)
data.select("TIME", "NEW_TIME").show()
#+----+--------+
#|TIME|NEW_TIME|
#+----+--------+
#| 925| 930|
#|2205| 2200|
#|2210| 2215|
#|2242| 2245|
#|2255| 2300|
#+----+--------+
关于apache-spark - Pyspark - 圆时间表示为最接近刻钟(15 分钟)的整数,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50345282/
我正在尝试学习 Fortran,并且看到了很多不同的定义,我想知道他们是否正在尝试完成同样的事情。以下有什么区别? 整数*4 整数(4) 整数(kind=4) 最佳答案 在 Fortran >=90
我以前从未编程过,最近(1 周前)才开始学习!第一门类(class)是函数式编程,使用 Haskell。 我有一项学校作业,我想通过删除一两个步骤来改进它,但我遇到了一个讨厌的错误。 基本上,我创建了
给定以下GraphQL请求和变量: 请求: query accounts($filter:AccountFilter, $first_:String, $skip_:Int) { accounts
我已经搜索了 StackOverflow,但找不到关于如何检查计算器应用程序的数字输入正则表达式的答案,该计算器应用程序将检查每个 keyup 的以下格式(jquery key up): 任何整数,例
类似于我上一篇致歉的文章,但没有那么长篇大论。基本上我想知道当每次重绘调用只重绘屏幕的一小部分时,优化重绘到 JFrame/JPanel 的最佳选择是什么。 此外,除了重绘重载之外,我并不是 100%
所以在我的教科书中有一个使用 f# 的递归函数的例子 let rec gcd = function | (0,n) -> n | (m,n) -> gcd(n % m,m);; 使用此功能,我的教科书
我有一个数据结构,例如表达式树或图形。我想添加一些“测量”功能,例如depth和 size . 如何最好地键入这些函数? 我认为以下三个变体的用处大致相同: depth :: Expr -> Int
这样写比较好 int primitive1 = 3, primitive2 = 4; Integer a = new Integer(primitive1); Integer b = new Inte
我是 Java 8 新手,想根据键对 Map 进行排序,然后在值内对每个列表进行排序。 我试图寻找一种 Java 8 方法来对键和值进行排序。HashMap>映射 map.entrySet().str
这就是我的目标... vector ,int> > var_name (x, pair (y),int>); 其中 x 是 vector var_name 的大小,y 是对内 vector 的大小。
这里是 an answer to "How do I instantiate a Queue object in java?" , Queue is an interface. You can't i
这个问题在这里已经有了答案: Weird Integer boxing in Java (12 个答案) Why are autoboxed Integers and .getClass() val
我们可以使用 C++ STL 做这样的事情吗?如果是,我将如何初始化元素?我试图这样做,但没有成功。 pair,vector>p; p.first[0]=2; 最佳答案 Can we do som
您好,我正在尝试为百分比和整数数组中的数字找到索引。假设 arraynum = ['10%','250','20%','500'] 并且用户发送一个值 15%,这个数字在哪个范围内居住?我可以使用这段
我与三列有关系:ProductName、CategoryID 和 Price。我需要选择仅那些价格高于给定类别中平均产品价格的产品。(例如,当apple(ProductName)是fruit(Cate
我已经坚持了一段时间,我正在尝试将一些数据配对在一起。这是我的代码。 #include #include using namespace std; int main() { pair data(
我收到错误:'(Int, Int)' 与 'CGPoint' 不相同 如何将 (Int, Int) 转换为 CGPoint let zigzag = [(100,100), (100,150)
我在 .cpp 文件中发现了以下代码。我不理解涉及头文件的构造或语法。我确实认识到这些特定的头文件与 Android NDK 相关。但是,我认为这个问题是关于 C++ 语法的一般问题。这些在某种程度上
我将这些输入到 Scala 解释器中: val a : Integer = 1; val b : Integer = a + 1; 我收到消息: :5: error: type mismatch;
C++:vector>v(size);当我试图打印出值时显示 0 作为值,但是当未声明 vector 大小时它显示正确的输出?为什么这样?例如: int x; cin>>x; vector>v(x);
我是一名优秀的程序员,十分优秀!