【发布时间】:2015-04-22 17:02:21
【问题描述】:
我是 NLP 的初学者,我很困惑如何使用 <s> 和 </s> 符号来计算一元模型的计数?我应该计算它们还是忽略它们?
【问题讨论】:
标签: nlp language-model
我是 NLP 的初学者,我很困惑如何使用 <s> 和 </s> 符号来计算一元模型的计数?我应该计算它们还是忽略它们?
【问题讨论】:
标签: nlp language-model
如果我正确理解 <s> 和 </s> 的意思是特殊(假)unigrams 作为每个文本的第一个和最后一个 unigrams(实际上是前第一个和后一个),那么它们就没有必要了对于 unigram,因为任何字符串都包含这些 unigram,因此它们不提供额外信息。
这种特殊的 unigram 在高阶 n-gram 的情况下很有用:例如,它允许从 1 字字符串中提取,如 hello 2 个二元组:<s> hello 和 hello </s> 或 3 个三元组: <s0> <s1> hello,<s1> hello </s1>,hello </s1> </s0>.
【讨论】: