【发布时间】:2023-01-16 16:19:40
【问题描述】:
我正在解析我的应用程序日志并将其写入文本文件。然后我将此文本文件转换为 json 文件以在其上运行一些分析,但由于我得到的格式,我无法在 json 文件上创建表。
文本文件包含 6 行描述,之后有一个与键值对相似的模式。我想将每个具有不同 jobId 的对象归为一个,但无法这样做。我已经尝试了 defaultdict 方法,该方法给出了类似对象的列表,但这不是我的用例。我在这里附上了文本和 json 文件。可以相应地更改文本文件的格式。 这是文本文件 sn-p :
Report_for Reconciliation
Execution_of application_1673496470638_0001
Spark_version 2.4.7-amzn-0
Java_version 1.8.0_352 (Amazon.com Inc.)
Start_time 2023-01-12 09:45:13.360000
Job_ID 0
Submission_time 2023-01-12 09:47:20.148000
Run_time 73957ms
Result JobSucceeded
Number_of_stages 1
Stage parquet at RawDataPublisher.scala:53
Stage_ID 0
Number_of_tasks 16907
Number_of_executed_tasks 16907
Completion_time 73207ms
Stage_executed parquet at RawDataPublisher.scala:53
Job_ID 1
Submission_time 2023-01-12 09:48:34.177000
Run_time 11525ms
Result JobSucceeded
Number_of_stages 2
Stage parquet at RawDataPublisher.scala:53
Stage_ID 1
Number_of_tasks 16907
Number_of_executed_tasks 0
Completion_time 0ms
Stage_executed parquet at RawDataPublisher.scala:53
Stage parquet at RawDataPublisher.scala:53
Stage_ID 2
Number_of_tasks 300
Number_of_executed_tasks 300
Completion_time 11520ms
Stage_executed parquet at RawDataPublisher.scala:53
Job_ID 2
Submission_time 2023-01-12 09:48:46.908000
Run_time 218358ms
Result JobSucceeded
Number_of_stages 1
Stage parquet at RawDataPublisher.scala:53
Stage_ID 3
Number_of_tasks 1135
Number_of_executed_tasks 1135
Completion_time 218299ms
Stage_executed parquet at RawDataPublisher.scala:53
这是 json 文件 sn-p :
【问题讨论】:
-
抱歉,我不明白预期的输出?你能解释一下或提供最终结果吗?
标签: python json apache-spark logging