【发布时间】:2017-04-14 16:41:34
【问题描述】:
我正在尝试使用 Spark-CSV 包 (https://github.com/databricks/spark-csv) 将 csv 文件读入 Spark DataFrames。
一切正常,但所有列都假定为StringType。
如 Spark SQL 文档 (https://spark.apache.org/docs/latest/sql-programming-guide.html) 所示,对于 JSON 等内置源,可以自动推断具有数据类型的架构。
CSV文件中的列类型可以自动推断吗?
【问题讨论】:
-
1. StringTypes 是 SparkSQL 中的一种字段类型。 2.你问的不是很清楚,你能不能更具体的说一下你想要达到的目标
-
我问的是自动类型推断,它在 JSON 等内置数据源中可用。 IE。如果有人使用
sqlContext.jsonFile("...")从 json 文件中创建 df,其中包含一个整数和一个字符串字段 - 这些类型将在模式中定义。 CSV 数据源格式可以做到这一点吗?