【发布时间】:2023-03-20 16:58:01
【问题描述】:
尝试从 JSON 文件创建 DataFrame,但是当我加载数据时,spark 会自动推断数据中的数值是 Long 类型,尽管它们实际上是整数,这也是我解析数据的方式我的代码。
由于我在测试环境中加载数据,我不介意使用一些变通方法来修复架构。我已经尝试了很多,例如:
- 手动更改架构
- 使用 UDF 转换数据
- 手动定义整个架构
问题是架构非常复杂,而且我所追求的字段是嵌套的,这使得上面的所有选项都不相关或太复杂而无法从头开始编写。
我的主要问题是,spark 如何确定数值是整数还是长整数?我能做些什么来强制所有\一些数字都是特定类型的吗?
谢谢!
【问题讨论】:
标签: json scala apache-spark spark-dataframe