【发布时间】:2017-10-06 13:57:45
【问题描述】:
我正在 apache spark 中使用 K-Means 聚类做一个简单的项目,我做了一些预处理步骤,如标记化、停用词去除器和 hashingTF。这些由 spark 自己的 Tokenization()、StopWordRemover() 和 HasingTF() 执行。但我想在应用 k-means 聚类之前执行词干提取。我在 openNLP 中尝试了一些 NLP 库。但我不知道如何在 spark DataFrame 中实现它。 有人可以帮我怎么做。
【问题讨论】:
-
我正在尝试在 build.sbt 文件中添加雪球词干。但它显示错误 Unresolved dependencies: master#spark-stemming_2.11;0.1.2 not found
标签: java apache-spark machine-learning nlp