【发布时间】:2016-01-21 17:18:17
【问题描述】:
我有两个文件。一个有普通数据的大的,一个有分行模式的。
如何使用 map reduce 算法计算大文件中出现的所有模式,特别是在使用 python (pyspark) 的 Apache Spark 引擎中。
数据文件:
ABCDEFABCDERFADACCABCDEABA.....
模式文件:
ABC
BCF
CDE
【问题讨论】:
-
我是 Spark 的新手,我刚刚阅读了示例。 PattenFile 最多有 100 条记录,
-
DataFile怎么样?已经分裂了吗? -
不,这是一个大文件(1GB)
标签: apache-spark mapreduce pyspark