【发布时间】:2015-09-18 00:15:39
【问题描述】:
基于 1.4 (https://spark.apache.org/docs/1.4.0/mllib-feature-extraction.html) 的 Spark 文档,我正在编写一个 TF-IDF 示例,用于将文本文档转换为值向量。给出的示例显示了如何做到这一点,但输入是令牌的 RDD 没有键。这意味着我的输出 RDD 不再包含引用原始文档的索引或键。例子是这样的:
documents = sc.textFile("...").map(lambda line: line.split(" "))
hashingTF = HashingTF()
tf = hashingTF.transform(documents)
我想做这样的事情:
documents = sc.textFile("...").map(lambda line: (UNIQUE_LINE_KEY, line.split(" ")))
hashingTF = HashingTF()
tf = hashingTF.transform(documents)
并让生成的tf 变量在某处包含UNIQUE_LINE_KEY 值。我只是错过了一些明显的东西吗?从示例看来,没有很好的方法将document RDD 与tf RDD 联系起来。
【问题讨论】:
标签: apache-spark apache-spark-mllib tf-idf