【发布时间】:2020-12-13 16:41:22
【问题描述】:
我有一个包含两列(“time_stamp”和“message”)的 spark 数据框。
示例数据框:
Time_stamp Message
2020-12-01 05:28:34:215 some text1 ID: 1
2020-12-01 05:28:40:210 some text2 error: A
2020-12-01 05:28:40:220 some text3 error: B
2020-12-01 05:28:41:203 some text4 error: A
2020-12-01 05:30:43:201 some text5 ID: 1
2020-12-01 05:32:50:215 some text6 ID: 2
2020-12-01 05:32:50:220 some text7 error: A
2020-12-01 05:48:51:220 some text8 error: C
2020-12-01 05:48:52:203 some text9 error: B
2020-12-01 05:51:53:201 some text10 ID: 2
我想在包含相同 ID 的两行之间创建另一个带有 ID 和明显错误的数据框。
预期输出:
示例表:
ID Error
1 A
1 B
2 A
2 C
2 B
谢谢
【问题讨论】:
-
我基本上是在数据块上使用 Apache spark 并拥有一个 spark 数据框。 SQL 查询可以在这个数据帧上运行。因此 mysql 查询可以轻松运行用于 spark 数据帧。使用 spark.sql
-
Spark SQL 与 MySQL 不同。您不能在 Spark 数据帧上运行 MySQL 查询。这些查询称为 Spark SQL 查询。
-
哦,我明白了。感谢您的澄清。
标签: apache-spark pyspark apache-spark-sql