【问题标题】:how can we perform zip operation in databricks using python or anyway?我们如何使用 python 或无论如何在数据块中执行 zip 操作?
【发布时间】:2022-01-18 07:44:36
【问题描述】:

收到以下错误
OSError:[Errno 95] 不支持操作。
尝试从 Python 和 R、scala 将文件附加到 zip 文件时发生错误。

【问题讨论】:

  • 请提供足够的代码,以便其他人更好地理解或重现问题。

标签: python apache-spark pyspark databricks


【解决方案1】:

您似乎正在尝试修改 DBFS 上的文件。问题是当您通过本地 API(/dbfs 熔断器)处理 DBFS 上的文件时,存在limitations。例如,它不支持 ZIP 文件所需的随机写入。来自文档:

不支持随机写入。对于需要随机写入的工作负载,请先在本地磁盘上执行 I/O,然后将结果复制到 /dbfs

您的代码可能是(将文件复制到本地磁盘,执行修改,将文件复制回来):

dbutils.fs.cp("your_file_on_dbfs", "file:/tmp/temp-file.zip")
... perform append
dbutils.fs.cp("file:/tmp/temp-file.zip", "your_file_on_dbfs")

【讨论】:

  • 嗨,亚历克斯,感谢您的回答。但它不适用于我的情况。
  • 什么不起作用?有什么具体错误吗?
猜你喜欢
  • 2015-07-14
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-01-24
  • 2012-12-14
  • 2019-07-01
  • 2012-06-03
  • 1970-01-01
相关资源
最近更新 更多