【发布时间】:2020-07-02 16:37:38
【问题描述】:
我的计算机上保存了一个 PipelineModel,但我无法使用 PipelineModel.load(path) 加载。
当我在 Databricks 集群中启动我的代码时,它可以工作。 path 是我保存在 DBFS 上的模型的路径,可通过安装点访问:path = "/dbfs/path/to/my/model。
但是在我的机器上,调用PipelineModel.load("C:\\Users\\path\\to\\my\\model") 会抛出ValueError("RDD is empty")。
以下是模型在我的计算机上的保存方式:
\---model
+---metadata
| part-00000
| _SUCCESS
|
\---stages
+---0_CountVectorizer_b92625354bf7
| +---data
| | part-00000-tid-9156766819779394023-5cf6aecb-8959-48b3-be24-65bfa0543465-62-1-c000.snappy.parquet
| | _committed_9156766819779394023
| | _started_9156766819779394023
| | _SUCCESS
| |
| \---metadata
| part-00000
| _SUCCESS
|
\---1_LinearSVC_108fa01daf43
+---data
| part-00000-tid-4403060754466700849-27841dd9-de88-4015-9dfa-7854c2a15f15-65-1-c000.snappy.parquet
| _committed_4403060754466700849
| _started_4403060754466700849
| _SUCCESS
|
\---metadata
part-00000
_SUCCESS
(我刚刚将模型从我的 DataLake 下载到我的电脑)
在本地运行代码时如何加载此模型?
【问题讨论】:
-
我知道这个问题:stackoverflow.com/questions/51257956/… 但是我使用的是 Windows 个人计算机并且不能/不想使用 HDFS
-
你能试试
PipelineModel.load("file///C:/path/to/model")吗? -
@SomeshwarKale:我有同样的错误。为什么加载此路径会有所不同?
标签: python apache-spark pyspark