【问题标题】:Is it possible to detokenize DataFrame in PySpark?是否可以在 PySpark 中对 DataFrame 进行去标记化?
【发布时间】:2021-02-16 22:58:57
【问题描述】:

我正在使用 app.zelp.com 来执行 NLP。在标记化和删除停用词之后,我想对剩余的单词进行去标记化并导出到 csv。这可能吗?

%python
# Start Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("StopWords").getOrCreate()
from pyspark.ml.feature import Tokenizer, StopWordsRemover 
from pyspark import SparkFiles
url ="myamazon s3 url"
spark.sparkContext.addFile(url)
df = spark.read.csv(SparkFiles.get("myfile.csv"), sep=",", header=True)

# Tokenize DataFrame
review_data = Tokenizer(inputCol="Text", outputCol="Words")
# Transform DataFrame
reviewed = review_data.transform(df)
# Remove stop words
remover = StopWordsRemover(inputCol="Words", outputCol="filtered")
newFrame = remover.transform(reviewed)

final = newFrame.select("filtered")

我想合并剩余的单词并导出到 csv。有可能吗?

【问题讨论】:

    标签: python apache-spark pyspark nlp tokenize


    【解决方案1】:

    您可以考虑使用 Spark-NLP Tokenizer 进行标记化,然后使用 TokenAssembler 组装回标记,

    https://nlp.johnsnowlabs.com/docs/en/transformers#tokenassembler-getting-data-reshaped

    阿尔贝托。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-07-03
      • 1970-01-01
      • 1970-01-01
      • 2013-09-30
      • 2016-04-23
      • 1970-01-01
      • 2016-02-08
      • 2019-03-28
      相关资源
      最近更新 更多