【发布时间】:2018-07-19 03:53:49
【问题描述】:
我正在尝试从我的原始数据中提取特征。
我的原始数据是Seq[String]。
我想将其转换为带有多个 1 而不是只有一个的 OneHot 编码,但似乎 spark ml https://spark.apache.org/docs/latest/ml-features.html#onehotencoderestimator 只接受单个 String 作为输入。
也许我是盲人,但我似乎找不到一个接受字符串列表的人。
谢谢。
【问题讨论】:
-
在二进制变体中使用
CountVectorizer或HashingTF? -
所以我使用了
HashingTF,但是您如何能够从编码返回到令牌?我去看看CountVectorizer -
如果您需要详细信息,请联系
CountVectorizer- How to get word details from TF Vector RDD in Spark ML Lib?
标签: scala apache-spark