gpt4 book ai didi

python - Spark __getnewargs__ 错误

转载 作者:太空狗 更新时间:2023-10-29 18:25:10 26 4
gpt4 key购买 nike

我正在尝试通过将 Spark DataFrame 映射到 RDD 然后再映射回 DataFrame 来清理它。这是一个玩具示例:

def replace_values(row,sub_rules):
d = row.asDict()
for col,old_val,new_val in sub_rules:
if d[col] == old_val:
d[col] = new_val
return Row(**d)
ex = sc.parallelize([{'name': 'Alice', 'age': 1},{'name': 'Bob', 'age': 2}])
ex = sqlContext.createDataFrame(ex)
(ex.map(lambda row: replace_values(row,[(col,1,3) for col in ex.columns]))
.toDF(schema=ex.schema))

运行上面的代码会导致 Py4JError,其中有一个很长的堆栈跟踪,结尾如下:

Py4JError: An error occurred while calling o801.__getnewargs__. Trace:
py4j.Py4JException: Method __getnewargs__([]) does not exist
at py4j.reflection.ReflectionEngine.getMethod(ReflectionEngine.java:333)
at py4j.reflection.ReflectionEngine.getMethod(ReflectionEngine.java:342)
at py4j.Gateway.invoke(Gateway.java:252)
at py4j.commands.AbstractCommand.invokeMethod(AbstractCommand.java:133)
at py4j.commands.CallCommand.execute(CallCommand.java:79)
at py4j.GatewayConnection.run(GatewayConnection.java:207)
at java.lang.Thread.run(Thread.java:745)

这是怎么回事?我如何解决它?我正在使用 PySpark 1.5.2。

最佳答案

该错误是由于.map(lambda...) 语句中对ex.columns 的引用引起的。您不能在 RDD 转换中使用的函数内引用 RDD。 Spark 是 supposed to issue more helpful errors in this case , 但显然这并没有进入这个版本。

解决方案是用引用变量的副本替换引用:

def replace_values(row,sub_rules):
d = row.asDict()
for col,old_val,new_val in sub_rules:
if d[col] == old_val:
d[col] = new_val
return Row(**d)
ex = sc.parallelize([{'name': 'Alice', 'age': 1},{'name': 'Bob', 'age': 2}])
ex = sqlContext.createDataFrame(ex)
cols = copy.deepcopy(ex.columns)
(ex.map(lambda row: replace_values(row,[(col,1,3) for col in cols]))
.toDF(schema=ex.schema))

关于python - Spark __getnewargs__ 错误,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/34443475/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com