【问题标题】:How to get line without header from dataframe into list with pyspark如何使用pyspark将没有标题的行从数据框中获取到列表中
【发布时间】:2019-02-22 06:27:20
【问题描述】:

我从 CSV 文件中获取此数据,我需要将此数据发送到服务器。但我只需要这个列表中的值。

{1: Row(Moid=1, Tripid='1', Tstart='2007-05-27', Tend='2007-05-27 08:36:47.846', Xstart='12785', Ystart='1308', Xend='12785', Yend='1308'), 2: Row(Moid=2, Tripid='10', Tstart='2007-05-27', Tend='2007-05-28 08:52:53.673', Xstart='9716', Ystart='-55', Xend='9716', Yend='-55')}

我想要这个

{ (1,  1, 2007-05-27, 2007-05-2708:36:47.846 , 12785, 1308, 12785, 1308)
  (2, 10, 2007-05-27, 2007-05-2808:52:53.673 ,  9716,  -55,  9716,  -55)

【问题讨论】:

    标签: python dataframe multidimensional-array pyspark


    【解决方案1】:

    您可以使用 rdd 和将行转换为元组的 map 函数。 我刚刚将您的前 3 个值用于示例实现:

    df = spark.createDataFrame([(1,"1",'2007-05-27'),(2,"10", "2007-05-27")], ['moid',"tripid","tstart"])
    print df.rdd.map(lambda r: tuple(r)).collect()
    

    输出将是一个元组列表:

    [(1, u'1', u'2007-05-27'), (2, u'10', u'2007-05-27')]
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-12-03
      • 2021-05-23
      • 2017-10-23
      • 1970-01-01
      • 2021-12-26
      • 2017-02-06
      相关资源
      最近更新 更多