【问题标题】:ValueError when loading a PipelineModel on a personal computer在个人计算机上加载 PipelineModel 时出现 ValueError
【发布时间】:2020-07-02 16:37:38
【问题描述】:

我的计算机上保存了一个 PipelineModel,但我无法使用 PipelineModel.load(path) 加载。

当我在 Databricks 集群中启动我的代码时,它可以工作。 path 是我保存在 DBFS 上的模型的路径,可通过安装点访问:path = "/dbfs/path/to/my/model

但是在我的机器上,调用PipelineModel.load("C:\\Users\\path\\to\\my\\model") 会抛出ValueError("RDD is empty")

以下是模型在我的计算机上的保存方式:

\---model
    +---metadata
    |       part-00000
    |       _SUCCESS
    |
    \---stages
        +---0_CountVectorizer_b92625354bf7
        |   +---data
        |   |       part-00000-tid-9156766819779394023-5cf6aecb-8959-48b3-be24-65bfa0543465-62-1-c000.snappy.parquet
        |   |       _committed_9156766819779394023
        |   |       _started_9156766819779394023
        |   |       _SUCCESS
        |   |
        |   \---metadata
        |           part-00000
        |           _SUCCESS
        |
        \---1_LinearSVC_108fa01daf43
            +---data
            |       part-00000-tid-4403060754466700849-27841dd9-de88-4015-9dfa-7854c2a15f15-65-1-c000.snappy.parquet
            |       _committed_4403060754466700849
            |       _started_4403060754466700849
            |       _SUCCESS
            |
            \---metadata
                    part-00000
                    _SUCCESS

(我刚刚将模型从我的 DataLake 下载到我的电脑)

在本地运行代码时如何加载此模型?

【问题讨论】:

  • 我知道这个问题:stackoverflow.com/questions/51257956/… 但是我使用的是 Windows 个人计算机并且不能/不想使用 HDFS
  • 你能试试PipelineModel.load("file///C:/path/to/model")吗?
  • @SomeshwarKale:我有同样的错误。为什么加载此路径会有所不同?

标签: python apache-spark pyspark


【解决方案1】:

对于其他努力解决相同问题的人,请务必实际下载 blob...我的代码中有一个拼写错误,导致下载了错误的 blob,导致所有文件为空。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-02-22
    • 2023-03-26
    • 1970-01-01
    • 2014-03-28
    • 1970-01-01
    • 2022-11-30
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多