【发布时间】:2018-08-05 09:45:00
【问题描述】:
我正在尝试使用 NLTK 拆分句子,我注意到它将中间没有空格的句子视为一个句子。例如:
text = 'Today is Monday.I went shopping.'
sentences = sent_tokenize(text)
# 1) Today is Monday.I went shopping.
text = 'Today is Monday. I went shopping.'
sentences = sent_tokenize(text)
# 1) Today is Monday.
# 2) I went shopping.
有没有办法正确分割错标/错位的句子?
【问题讨论】:
-
你将如何区分“只有我们 2.1 人饿了。”来自“我们的结果是 2.1,我们很饿。”?
-
但在我的示例中,'.' 周围的字符不是数字。