作者热门文章
- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我将以下代码打包在 whl 文件中:
from pkg_resources import resource_filename
def path_to_model(anomaly_dir_name: str, data_path: str):
filepath = resource_filename(anomaly_dir_name, data_path)
return filepath
def read_data(spark) -> DataFrame:
return (spark.read.parquet(str(path_to_model("sampleFolder", "data"))))
我确认 whl 文件正确包含 sampleFolder/data/目录下的 Parquet 文件。当我在本地运行它时,它可以工作,但是当我将此 whl 文件上传到 dbfs 并运行时,我收到此错误:
AnalysisException: Path does not exist: dbfs:/databricks/python/lib/python3.7/site-packages/sampleFolder/data;
我确认这个目录实际上不存在:dbfs:/databricks/python
最佳答案
默认情况下,Spark on Databricks 使用 DBFS 上的文件,直到您明确更改架构。在您的情况下,path_to_model
函数返回字符串 /databricks/python/lib/python3.7/site-packages/sampleFolder/data
,并且因为它没有显式模式,所以 Spark 使用 dbfs
架构。但是文件在本地节点上,而不是在 DBFS 上——这就是 Spark 找不到它的原因。
要解决这个问题,您需要将数据复制到 DBFS,然后从那里读取。这可以通过 dbutils.fs.cp
来完成命令。将代码更改为以下内容:
def read_data(spark) -> DataFrame:
data_path = str(path_to_model("sampleFolder", "data"))
tmp_path = "/tmp/my_sample_data"
dbutils.fs.cp("file:" + data_path, tmp_path, True)
return (spark.read.parquet(tmp_path))
关于python - AnalysisException : Path does not exist: dbfs:/databricks/python/lib/python3. 7/site-packages/sampleFolder/data;,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/68202341/
我将以下代码打包在 whl 文件中: from pkg_resources import resource_filename def path_to_model(anomaly_dir_name: s
我是一名优秀的程序员,十分优秀!