【问题标题】:Import data using Spark Scala使用 Spark Scala 导入数据
【发布时间】:2020-03-04 06:14:40
【问题描述】:

我有一个大型数据集,我想将其导入数据块以使用 scala 进行一些分析。 该数据集可在此链接中找到:https://drive.google.com/open?id=1g4YYALk3nArN8bX2uFS70IpbdSf_Efqj

我想导入这个数据集,文档 ID 在第一列,其他测试数据在另一列。

但是当我使用以下代码导入数据时,它看起来像这样

val df = spark.read.text("FileStore/tables/plot_summaries.txt")

df.select("value").show()

谁能帮助我以正确的方式导入它?任何帮助将不胜感激。谢谢你

【问题讨论】:

标签: scala apache-spark databricks


【解决方案1】:

这将解决您的问题。

spark.read.option("sep", "\t").text("FileStore/tables/plot_summaries.txt")

【讨论】:

    【解决方案2】:

    你有带制表符的数据,所以你需要在外部提供一个分隔符。

    scala> import org.apache.spark.sql.types._
    scala> val schema = new StructType().add("DocumentID", LongType, true).add("Description", StringType, true)
    
    scala> val df = spark.read.format("csv").option("delimiter", "\t").schema(schema).load("/plot_summaries.txt")
    
    scala> df.show(10)
    +----------+--------------------+
    |DocumentID|         Description|
    +----------+--------------------+
    |  23890098|Shlykov, a hard-w...|
    |  31186339|The nation of Pan...|
    |  20663735|Poovalli Induchoo...|
    |   2231378|The Lemon Drop Ki...|
    |    595909|Seventh-day Adven...|
    |   5272176|The president is ...|
    |   1952976|{{plot}} The film...|
    |  24225279|The story begins ...|
    |   2462689|Infuriated at bei...|
    |  20532852|A line of people ...|
    +----------+--------------------+
    

    【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-12-30
    • 2018-12-24
    • 1970-01-01
    • 1970-01-01
    • 2016-04-23
    • 2017-01-25
    • 2020-09-04
    • 1970-01-01
    相关资源
    最近更新 更多