【发布时间】:2017-09-23 05:15:48
【问题描述】:
我在我的 pyspark 数据框上使用 pyspark.ml.feature.StopWordsRemover 类。它有 ID 和 Text 列。除了提供的默认停用词列表外,我还想添加自己的自定义列表以从字符串中删除所有数值。
我可以看到提供了一个方法来为这个类添加 setStopWords。我想我正在努力使用正确的语法来使用这种方法。
from pyspark.sql.functions import *
from pyspark.ml.feature import *
a = StopWordsRemover(inputCol="words", outputCol="filtered")
b = a.transform(df)
上面的代码在过滤列中给了我预期的结果,但它只删除/停止标准单词。我正在寻找一种方法来添加我自己的自定义列表,该列表将包含我希望过滤的更多单词和数值。
【问题讨论】:
标签: python pyspark spark-dataframe text-mining stop-words