【发布时间】:2017-11-09 21:15:09
【问题描述】:
我正在使用出色的 tidytext 包来标记多个段落中的句子。例如,我想采取以下段落:
“我完全相信达西先生没有缺陷。他自己拥有它,毫不掩饰。”
并将其标记为两个句子
- “我完全相信达西先生没有缺陷。”
- “他自己拥有它,毫不掩饰。”
但是,当我使用 tidytext 的默认句子标记器时,我得到三个句子。
代码
df <- data_frame(Example_Text = c("I am perfectly convinced by it that Mr. Darcy has no defect. He owns it himself without disguise."))
unnest_tokens(df, input = "Example_Text", output = "Sentence", token = "sentences")
结果
# A tibble: 3 x 1
Sentence
<chr>
1 i am perfectly convinced by it that mr.
2 darcy has no defect.
3 he owns it himself without disguise.
什么是使用tidytext 标记句子但又不会遇到“先生”等常见缩写问题的简单方法?或“博士”被解释为句尾?
【问题讨论】:
-
下面有很好的答案。为了清楚起见,tidytext 中的默认分词来自于分词器包,您可以在这里看到句子分词是如何实现的:github.com/ropensci/tokenizers