java - 将 JavaRDD 转换为 DataFrame 时出现 Spark 错误 : java. util.Arrays$ArrayList 不是 array<string> 架构的有效外部类型-6ren

java - 将 JavaRDD 转换为 DataFrame 时出现 Spark 错误 : java. util.Arrays$ArrayList 不是 array 架构的有效外部类型

转载作者：行者123 更新时间：2023-12-01 18:07:53

26

4

我使用的是 Spark 2.1.0。对于以下代码，它读取文本文件并将内容转换为 DataFrame，然后输入到 Word2Vector 模型中:

SparkSession spark = SparkSession.builder().appName("word2vector").getOrCreate();
JavaRDD<String> lines = spark.sparkContext().textFile("input.txt", 10).toJavaRDD();
JavaRDD<List<String>> lists = lines.map(new Function<String, List<String>>(){
                public List<String> call(String line){
                    List<String> list = Arrays.asList(line.split(" "));
                    return list;
                }
            });

JavaRDD<Row> rows = lists.map(new Function<List<String>, Row>() {
                public Row call(List<String> list) {
                    return RowFactory.create(list);
                }
            });


StructType schema = new StructType(new StructField[] {
                        new StructField("text", new ArrayType(DataTypes.StringType, true), false, Metadata.empty()) 
                    });

Dataset<Row> input = spark.createDataFrame(rows, schema);
input.show(3);
Word2Vec word2Vec = new Word2Vec().setInputCol("text").setOutputCol("result").setVectorSize(100).setMinCount(0);
Word2VecModel model = word2Vec.fit(input);
Dataset<Row> result = model.transform(input);

抛出异常

java.lang.RuntimeException: Error while encoding: java.util.Arrays$ArrayList is not a valid external type for schema of array

发生在 input.show(3) 行，所以createDataFrame()导致异常的原因是 Arrays.asList()返回此处不支持的 Arrays$ArrayList 。然而Spark官方文档中有如下代码:

List<Row> data = Arrays.asList(
      RowFactory.create(Arrays.asList("Hi I heard about Spark".split(" "))),
      RowFactory.create(Arrays.asList("I wish Java could use case classes".split(" "))),
      RowFactory.create(Arrays.asList("Logistic regression models are neat".split(" ")))
    );

StructType schema = new StructType(new StructField[]{
      new StructField("text", new ArrayType(DataTypes.StringType, true), false, Metadata.empty())
});
Dataset<Row> documentDF = spark.createDataFrame(data, schema);

效果很好。如果不支持Arrays$ArrayList，那么这段代码如何工作？不同的是我正在转换 JavaRDD<Row>到 DataFrame 但官方文档正在转换 List<Row>到数据框。我相信 Spark Java API 有一个重载方法 createDataFrame() ，它接受 JavaRDD<Row>并根据提供的模式将其转换为 DataFrame。我很困惑为什么它不起作用。有人可以帮忙吗？

最佳答案

几天前我遇到了同样的问题，解决这个问题的唯一方法是使用数组的数组。为什么？以下是回复:

ArrayType 是 Scala 数组的包装器，它与 Java 数组一一对应。 Java ArrayList 默认情况下未映射到 Scala Array，因此这就是您收到异常的原因:

java.util.Arrays$ArrayList is not a valid external type for schema of array

因此，直接传递 String[] 应该有效:

RowFactory.create(line.split(" "))

但是由于 create 将对象列表作为输入，因为行可能有列列表，因此 String[] 被解释为字符串列的列表。这就是为什么需要 double 字符串数组的原因:

RowFactory.create(new String[][] {line.split(" ")})

但是，从 Spark 文档中的 Java 行列表构造 DataFrame 仍然是个谜。这是因为 SparkSession.createDataFrame 函数版本以行的第一个参数 java.util.List 进行特殊的类型检查和转换，以便将所有 Java Iterable(即 ArrayList)转换为 Scala 数组。然而，采用 JavaRDD 的 SparkSession.createDataFrame 直接将行内容映射到 DataFrame。

总而言之，这是正确的版本:

    SparkSession spark = SparkSession.builder().master("local[*]").appName("Word2Vec").getOrCreate();
    SparkContext sc = spark.sparkContext();
    sc.setLogLevel("WARN");
    JavaRDD<String> lines = sc.textFile("input.txt", 10).toJavaRDD();
    JavaRDD<Row> rows = lines.map(new Function<String, Row>(){
        public Row call(String line){
            return RowFactory.create(new String[][] {line.split(" ")});
        }
    });

    StructType schema = new StructType(new StructField[] {
            new StructField("text", new ArrayType(DataTypes.StringType, true), false, Metadata.empty())
    });
    Dataset<Row> input = spark.createDataFrame(rows, schema);
    input.show(3);

希望这能解决您的问题。

关于java - 将 JavaRDD 转换为 DataFrame 时出现 Spark 错误 : java. util.Arrays$ArrayList 不是 array<string> 架构的有效外部类型，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/43567333/

26

4

0

文章推荐： java - TrustManagerFactory - 忽略证书检查

文章推荐： visual-studio - 在 MSBuild 中获取 native exe 的文件版本

arrays - 为什么是 &array != &array[0]？
在 C 中: int a[10]; printf("%p\n", a); printf("%p\n", &a[0]); 产量: 0x7fff5606c600 0x7fff5606c600 这是我所期望
arrays - 替换 Array of Array 中元素的位置
我一直在尝试运行此循环来更改基于数组的元素的位置，但出现以下错误。不太确定哪里出了问题。任何想法或想法!谢谢。 var population = [[98, 8, 45, 34, 56], [9, 1
arrays - Ruby Array of Arrays 按值分组和计数
我正在尝试获取一个 Ruby 数组数组并将其分组以计算其值。数组有一个月份和一个 bool 值: array = [["June", false], ["June", false], ["June"
javascript - array.split ("stop here") array to array of arrays in javascript 数组
所以我们的目标是在遇到某个元素时将数组分割成子数组下面的示例 array.split("stop here") ["haii", "keep", "these in the same array bu
java - Arrays.stream(array) 与 Arrays.asList(array).stream()
在this问题已经回答了两个表达式是相等的，但在这种情况下它们会产生不同的结果。对于给定的 int[] 分数，为什么会这样: Arrays.stream(scores) .forEac
arrays - 我如何制作 Perl "array of arrays of hashes"？
我认为我需要的是哈希数组的数组，但我不知道如何制作它。 Perl 能做到吗？如果是这样，代码会是什么样子？最佳答案 perldoc perldsc是了解 Perl 数据结构的好文档。关于arra
android - GSON 解析 Array in array in array
我遇到了这个问题，从 API 中我得到一个扩展 JSON，其中包含一个名为坐标的对象，该对象是一个包含数组 o 数组的数组。为了更清楚地看这个例子: "coordinates": [
arrays - Postgres JSONB : where clause for arrays of arrays
postgres 中有(v 9.5，如果重要的话): create table json_test( id varchar NOT NULL, data jsonb NOT NULL, PRIM
arrays - bash中echo "${array[@]}"echo "${array[*]}"有什么区别
我用 echo "${array[@]}" 和 echo "${array[*]}" 得到了相同的结果。如果我这样做: mkdir 假音乐； touch fakemusic/{Beatles,Sto
arrays - Array of arrays of typealias 表达式类型不明确，没有更多上下文
我正在尝试创建 typealias 对象的数组数组 - 但我收到“表达式类型不明确，没有更多上下文”编译错误。这是我的代码: typealias TestClosure = ((message: St
python - array.array 与 numpy.array
如果您在 Python 中创建一维数组，使用 NumPy 包有什么好处吗？最佳答案这完全取决于您打算如何处理数组。如果您所做的只是创建简单数据类型的数组并进行 I/O，array模块就可以了。另
arrays - Perl6 : Pushing an array to an array of arrays with one element seems not to work as expected
当我将数组推送到只有一个数组作为其唯一元素的数组数组时，为什么会得到这种数据结构？ use v6; my @d = ( [ 1 .. 3 ] ); @d.push( [ 4 .. 6 ] ); @d.
arrays - 如何从 Array{Array{Int64,2},1} 转换为 Array{Int64,2}
在 Julia 中，我想将定义为二维数组向量的数据转换为二维矩阵数组。如下例所述，我想把数据s转换成数据t，但是至今没有成功。我该如何处理这个案子？ julia> s = [[1 2 3], [4
c - 1[&array] 是 &array[sizeof(array)/sizeof(array[0])] 的合适替代品还是太混淆了？
C 没有elementsof 关键字来获取数组的元素数。所以这通常由计算 sizeof(Array)/sizeof(Array[0]) 代替但这需要重复数组变量名。1[&Array] 是指向数组后第一
arrays - 为什么我可以调用 array.some() 而不是 array.every() 联合数组类型？
所以，假设我有一个像这样的(愚蠢的)函数: function doSomething(input: number|string): boolean { if (input === 42 || in
arrays - 需要的公式 : Sort array to array -"zig-zag"
我有以下数组: a = [1,2,3,4,5,6,7,8,9,10,11,12,13,14,15,16] 我将它用于一些像这样的视觉内容: 1 2 3 4 5 6 7 8 9 10
arrays - Scala:array.toList 与 array.to[List]
我想知道数组中的 .toList 与 .to[List] 之间有什么区别。我在spark-shell中做了这个测试，结果没有区别，但我不知道用什么更好。任何意见？ scala> val l = Arr
arrays - Array.Find和IndexOf用于完全相同对象的多个元素
我很难获得完全相同对象的多个元素的当前元素索引: $b = "A","D","B","D","C","E","D","F" $b | ? { $_ -contains "D" } 替代版本: $b =
arrays - Vuetify : How to do a v-select search in array of arrays
我正在尝试使用来自我的 API 的 v-select 执行 options，我将数据放在数组数组中。 Array which I got from API 它应该是一个带有搜索的 select，因为它
arrays - char *array 和 char array[] 之间的内存区别是什么？
这个问题在这里已经有了答案: String literals: pointer vs. char array (1 个回答) 4 个月前关闭。当我执行下一个代码时 int main() {

首页

博学

6Ren·AI

商城

java - 将 JavaRDD 转换为 DataFrame 时出现 Spark 错误 : java. util.Arrays$ArrayList 不是 array 架构的有效外部类型