Hadoop、 Apache 星火-6ren

Hadoop、 Apache 星火

转载作者：可可西里更新时间：2023-11-01 16:49:05

28

4

我已经在 Window 中安装了 Spark。我正在尝试从 D: 驱动器加载文本文件。 RDD 正在正常创建，但是当我对该接收错误执行任何操作时。我尝试了斜线的所有组合但没有成功

scala> val file = sc.textFile("D:\\file\\file1.txt")
15/12/16 07:53:51 INFO MemoryStore: ensureFreeSpace(175321) called with curMem=4
01474, maxMem=280248975
15/12/16 07:53:51 INFO MemoryStore: Block broadcast_2 stored as values in memory
 (estimated size 171.2 KB, free 266.7 MB)
15/12/16 07:53:51 INFO MemoryStore: ensureFreeSpace(25432) called with curMem=57
6795, maxMem=280248975
15/12/16 07:53:51 INFO MemoryStore: Block broadcast_2_piece0 stored as bytes in
memory (estimated size 24.8 KB, free 266.7 MB)
15/12/16 07:53:51 INFO BlockManagerInfo: Added broadcast_2_piece0 in memory on l
ocalhost:51963 (size: 24.8 KB, free: 267.2 MB)
15/12/16 07:53:51 INFO BlockManagerMaster: Updated info of block broadcast_2_pie
ce0
15/12/16 07:53:51 INFO SparkContext: Created broadcast 2 from textFile at <conso
le>:21
file: org.apache.spark.rdd.RDD[String] = D:\file\file1.txt MapPartitionsRDD[5] a
t textFile at <console>:21

RDD 正常创建，但是当我尝试对 RDD 执行任何操作时收到以下错误

scala> file.count()
org.apache.hadoop.mapred.InvalidInputException: Input path does not exist: file
/D:/file/file1.txt
        at org.apache.hadoop.mapred.FileInputFormat.singleThreadedListStatus(Fi
eInputFormat.java:285)
        at org.apache.hadoop.mapred.FileInputFormat.listStatus(FileInputFormat.
ava:228)
        at org.apache.hadoop.mapred.FileInputFormat.getSplits(FileInputFormat.j
va:313)
        at org.apache.spark.rdd.HadoopRDD.getPartitions(HadoopRDD.scala:203)
        at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:219)
        at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:217)
        at scala.Option.getOrElse(Option.scala:120)
        at org.apache.spark.rdd.RDD.partitions(RDD.scala:217)
        at org.apache.spark.rdd.MapPartitionsRDD.getPartitions(MapPartitionsRDD
scala:32)
        at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:219)
        at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:217)
        at scala.Option.getOrElse(Option.scala:120)
        at org.apache.spark.rdd.RDD.partitions(RDD.scala:217)
        at org.apache.spark.SparkContext.runJob(SparkContext.scala:1512)
        at org.apache.spark.rdd.RDD.count(RDD.scala:1006)
        at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:24)
        at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:29)
        at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:31)
        at $iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:33)
        at $iwC$$iwC$$iwC$$iwC.<init>(<console>:35)
        at $iwC$$iwC$$iwC.<init>(<console>:37)
        at $iwC$$iwC.<init>(<console>:39)
        at $iwC.<init>(<console>:41)
        at <init>(<console>:43)
        at .<init>(<console>:47)
        at .<clinit>(<console>)
        at .<init>(<console>:7)
        at .<clinit>(<console>)
        at $print(<console>)
        at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
        at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl
java:57)
        at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAcce
sorImpl.java:43)
        at java.lang.reflect.Method.invoke(Method.java:606)
        at org.apache.spark.repl.SparkIMain$ReadEvalPrint.call(SparkIMain.scala
1065)
        at org.apache.spark.repl.SparkIMain$Request.loadAndRun(SparkIMain.scala
1338)
        at org.apache.spark.repl.SparkIMain.loadAndRunReq$1(SparkIMain.scala:84
)
        at org.apache.spark.repl.SparkIMain.interpret(SparkIMain.scala:871)
        at org.apache.spark.repl.SparkIMain.interpret(SparkIMain.scala:819)
        at org.apache.spark.repl.SparkILoop.reallyInterpret$1(SparkILoop.scala:
56)
        at org.apache.spark.repl.SparkILoop.interpretStartingWith(SparkILoop.sc
la:901)
        at org.apache.spark.repl.SparkILoop.command(SparkILoop.scala:813)
        at org.apache.spark.repl.SparkILoop.processLine$1(SparkILoop.scala:656)
        at org.apache.spark.repl.SparkILoop.innerLoop$1(SparkILoop.scala:664)
        at org.apache.spark.repl.SparkILoop.org$apache$spark$repl$SparkILoop$$l
op(SparkILoop.scala:669)
        at org.apache.spark.repl.SparkILoop$$anonfun$org$apache$spark$repl$Spar
ILoop$$process$1.apply$mcZ$sp(SparkILoop.scala:996)
        at org.apache.spark.repl.SparkILoop$$anonfun$org$apache$spark$repl$Spar
ILoop$$process$1.apply(SparkILoop.scala:944)
        at org.apache.spark.repl.SparkILoop$$anonfun$org$apache$spark$repl$Spar
ILoop$$process$1.apply(SparkILoop.scala:944)
        at scala.tools.nsc.util.ScalaClassLoader$.savingContextLoader(ScalaClas
Loader.scala:135)
        at org.apache.spark.repl.SparkILoop.org$apache$spark$repl$SparkILoop$$p
ocess(SparkILoop.scala:944)
        at org.apache.spark.repl.SparkILoop.process(SparkILoop.scala:1058)
        at org.apache.spark.repl.Main$.main(Main.scala:31)
        at org.apache.spark.repl.Main.main(Main.scala)
        at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
        at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl
java:57)
        at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAcce
sorImpl.java:43)
        at java.lang.reflect.Method.invoke(Method.java:606)
        at org.apache.spark.deploy.SparkSubmit$.org$apache$spark$deploy$SparkSu
mit$$runMain(SparkSubmit.scala:569)
        at org.apache.spark.deploy.SparkSubmit$.doRunMain$1(SparkSubmit.scala:1
6)
        at org.apache.spark.deploy.SparkSubmit$.submit(SparkSubmit.scala:189)
        at org.apache.spark.deploy.SparkSubmit$.main(SparkSubmit.scala:110)
        at org.apache.spark.deploy.SparkSubmit.main(SparkSubmit.scala)


scala>

最佳答案

你必须使用 sc.textFile("file:///...")

默认情况下，它可能会查看 HDFS。通过使用 file 协议(protocol)，您将使用本地文件系统。

在 Windows 上，我可以使用此命令

sc.textFile("file:\\C:\\Users\\data.txt").count()

为您尝试 sc.textFile("file:\\D:\\file\\file1.txt")。还要检查你是否有 D:/file/file.txt 权限。你可以去文件浏览器看看你对目录文件和文件file.txt有什么权限

关于Hadoop、 Apache 星火，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/34303140/

28

4

0

文章推荐： hadoop - 在hdfs中找不到仓库

文章推荐： c# - 如何阻止 HTTP 转义引号？

文章推荐： java - java与google-app-engine通信时报错302

文章推荐： hadoop - 设置协调器oozie文件不存在报错如何解决

Hadoop、 Apache 星火
我已经在 Window 中安装了 Spark。我正在尝试从 D: 驱动器加载文本文件。 RDD 正在正常创建，但是当我对该接收错误执行任何操作时。我尝试了斜线的所有组合但没有成功 scala> val
java - Apache 星火 Mllib
我正在尝试使用 Spark 的 MLlib 在 Java 上实现 KMeans，我偶然发现了一个问题，那就是，尽管我导入了正确的 jar，但我的编译器无法识别这一行 // Cluster the da
java - 星火 UnsupportedOperationException : empty collection
在尝试使用 Databricks 提供的动手实验室执行 spark mllib ALS 时，是否有人知道此错误的可能原因？ 14/11/20 23:33:38 WARN Utils: Set SPAR
scala - Apache 星火。 UDF 列基于另一列，而不将其名称作为参数传递。
DataSet 中有 firm 列，我正在向该 DataSet 添加另一列 - firm_id 示例: private val firms: mutable.Map[String, Integer]
hadoop - 星火 2.2.0 FileOutputCommitter
DirectFileOutputCommitter 在 Spark 2.2.0 中不再可用。这意味着写入 S3 需要非常长的时间(3 小时对 2 分钟)。我可以通过在 spark-shell 中将 F
scala - Apache 星火 : get elements of Row by name
在 DataFrame Apache Spark 中的对象(我正在使用 Scala 接口(interface))，如果我正在迭代它的 Row对象，有没有办法按名称提取值？我可以看到如何做一些非常尴尬的
apache-spark - Apache 星火 : ERROR Executor -> Iterator
我正在尝试从此处 (Learning Spark book) 运行示例，但出现以下错误: 16/10/07 01:15:26 ERROR Executor: Exception in task 0.0
python - Apache 星火 : How to use pyspark with Python 3
我从 GH 开发大师那里构建了 Spark 1.4，并且构建顺利。但是当我执行 bin/pyspark 时，我得到了 Python 2.7.9 版本。我该如何更改？最佳答案只需设置环境变量: 导出
java - 星火 2.0.1 java.lang.NegativeArraySizeException
我开始玩 Spark 2.0.1。新数据集 API 非常干净，但我在执行非常简单的操作时遇到了问题。也许我遗漏了什么，希望有人能提供帮助。这些说明 SparkConf conf = new Spa
java - 星火 java : Creating a new Dataset with a given schema
我有这段代码在 scala 中运行良好: val schema = StructType(Array( StructField("field1", StringType, true),
caching - Apache 星火 : User Memory vs Spark Memory
我正在构建一个 Spark 应用程序，我必须在其中缓存大约 15 GB 的 CSV 文件。我读到了新的 UnifiedMemoryManager Spark 1.6 在这里介绍: https://0x
apache-spark - 星火 ML : Taking square root of feature columns
您好，我正在使用自定义 UDF 对每列中的每个值求平方根。 square_root_UDF = udf(lambda x: math.sqrt(x), DoubleType()) for x in f
apache-spark - Apache 星火 : setting executor instances does not change the executors
我有一个 Apache Spark 应用程序在集群模式下运行在 YARN 集群上(spark 在这个集群上有 3 个节点)。当应用程序运行时，Spark-UI 显示 2 个执行程序(每个运行在不同的
postgresql - 星火 SQL 2.0 : NullPointerException with a valid PostgreSQL query
我有一个有效的 PostgreSQL 查询:当我在 PSQL 中复制/粘贴它时，我得到了想要的结果。但是，当我使用 Spark SQL 运行时，它会导致 NullPointerException。
scala - 星火 SQL : access file in current worker node directory
我需要使用 spark-sql 读取一个文件，该文件在当前目录中。我使用此命令解压缩存储在 HDFS 上的文件列表。 val decompressCommand = Seq(laszippath,
java - 星火 & Maven : SecurityException: Invalid Signature file digest for Manifest
提交复制并粘贴到下方的 Spark 应用程序时，我遇到了以下错误。我首先对这个问题进行了一些谷歌搜索，并确定这可能是一个签名 jar 的问题，该签名 jar 作为对我的 jar 构建过程的依赖项被加载
scala - 星火(斯卡拉): groupby and aggregate list of values to one list based on index
这个问题在这里已经有了答案: How to aggregate values into collection after groupBy? (3 个答案) Spark merge/combine a
apache-spark - Apache 星火 : Using folder structures to reduce run-time of analyses
我想通过将一个巨大的 csv 文件分割为不同的分区来优化 Spark 应用程序的运行时间，具体取决于它们的特性。例如。我有一列带有客户 ID(整数，a)，一列带有日期(月 + 年，例如 01.201
hadoop - 星火-Hadoop-> org.apache.hadoop.mapred.InvalidInputException : Input path does not exist
我在尝试将文件从 hdfs 读取到 Spark 时遇到错误。文件 README.md 存在于 hdfs 中 spark@osboxes hadoop]$ hdfs dfs -ls README.md
apache-spark - 星火-SQL : Unable to instantiate org. apache.hadoop.hive.metastore.HiveMetaStoreClient
一段时间后，无法弄清楚如何在运行 spark-sql 二进制文件时识别以下错误的根本原因: 15/12/08 14:48:41 WARN NativeCodeLoader: Unable to loa

首页

博学

6Ren·AI

商城

Hadoop、 Apache 星火