【问题标题】:how to treat with <s> and </s> in calculating unigram LM?在计算unigram LM时如何处理<s>和</s>?
【发布时间】:2015-04-22 17:02:21
【问题描述】:

我是 NLP 的初学者,我很困惑如何使用 &lt;s&gt;&lt;/s&gt; 符号来计算一元模型的计数?我应该计算它们还是忽略它们?

【问题讨论】:

    标签: nlp language-model


    【解决方案1】:

    如果我正确理解 &lt;s&gt;&lt;/s&gt; 的意思是特殊(假)unigrams 作为每个文本的第一个和最后一个 unigrams(实际上是前第一个和后一个),那么它们就没有必要了对于 unigram,因为任何字符串都包含这些 un​​igram,因此它们不提供额外信息。

    这种特殊的 unigram 在高阶 n-gram 的情况下很有用:例如,它允许从 1 字字符串中提取,如 hello 2 个二元组:&lt;s&gt; hellohello &lt;/s&gt; 或 3 个三元组: &lt;s0&gt; &lt;s1&gt; hello,&lt;s1&gt; hello &lt;/s1&gt;,hello &lt;/s1&gt; &lt;/s0&gt;.

    【讨论】:

      猜你喜欢
      • 2020-04-03
      • 2014-09-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多