【发布时间】:2019-12-30 08:30:16
【问题描述】:
我在 R 中将 ft_tokenizer 用于 spark 数据帧。 它对每个单词进行标记并将其更改为全部较低,我希望单词采用它们最初的格式。
text_data <- data_frame(
x = c("This IS a sentence", "So is this")
)
tokenized <- text_data_tbl %>%
ft_tokenizer("x", "word")
tokenized$word
## [[1]]
## [[1]][[1]]
## [1] "this"
##
## [[1]][[2]]
## [1] "is"
##
## [[1]][[3]]
## [1] "a"
我想要:
tokenized$word
## [[1]]
## [[1]][[1]]
## [1] "This"
##
## [[1]][[2]]
## [1] "IS"
##
## [[1]][[3]]
## [1] "a"
【问题讨论】:
-
为什么您认为大写很重要?我只是好奇你对 nlp 的想法。
-
我想使用标记化的单词将其与关键字列表进行匹配,为此我需要完全匹配。即,在关键字列表中,如果我有“This”,我想要与它完全匹配,这现在是不可能的,因为标记化会将“This”更改为“this”。
-
不,我不想将每个首字母都改成大写。我只是希望它按原样标记单词。我将更准确地编辑我的查询。
标签: r apache-spark apache-spark-sql sparkr sparklyr