【问题标题】:Corpus file format for MosesMoses 的语料库文件格式
【发布时间】:2013-01-16 20:37:20
【问题描述】:

我正在使用 Moses 制作语言模型。

我按照此链接中的说明进行操作:Baseline System: Moses

我有 google 1-gram 文件,看起来像:

</S>    95119665584
<S>     95119665584
,       30578667846
.       22077031422
<UNK>   21594821357
the     19401194714
-       16337125274
of      12765289150
and     12522922536

这意味着“of”这个词出现了 12,765,289,150 次。

现在我想从这个文件中创建一个语言模型(“构建语言模型”),

我不知道这种文件格式是否适用于 Moses。

在教程中他们正在使用“europarl-v6.en”,但我无法在网上找到它来检查文件格式。

最后编辑:

我需要将每个字母表示为单词,所以“hello”变成了“h e l l o”。

按照我所说的表示每个单词后,我应该使用哪种格式?

应该是:

o f
o f
o f
a n d
a n d

或者喜欢原来的格式:

o f       12765289150
a n d     12522922536

或者可能是其他格式?

它仍然算作 google n-gram 吗?

我点击了链接:How can I use the Google Web N-gram corpus to build an LM as @ MukundKRoy 建议,但我不知道如何在我的情况下使用它(1-gram,2-gram...我的新文件不是 const)。

如果有人能告诉我这个文件应该是什么格式以便尽可能简单地与 SRILM 一起使用,我会很高兴。 谢谢

【问题讨论】:

    标签: linux moses


    【解决方案1】:

    SRILM 正在处理 1-2-3..-gram,不要打扰。

    我做过类似的事情,看看这里:

    Moses Installation and Training Run-Through

    PART II - Build a Model 部分 Build Language Model 中,它与 google n-grams 完美搭配。

    如果这对你有用,请告诉我。

    【讨论】:

      【解决方案2】:

      您可以使用CMU-Cambridge Statistical Language Modeling Toolkit 来构建您的语言模型。请参阅 wfreq2vocabtext2wngram。我认为这种格式的 LM 可以很好地与 moses 配合使用。

      【讨论】:

      • 谢谢,但我必须用摩西,你知道文件的格式是什么吗?
      • 摩西可以同时使用 SRILM 和 IRSTLM,而我使用 SRILM。由于您只有一元数据,因此不会有退避权重。因此,根据 SRILM 格式,您需要有“概率”“一元”和第三列空白。试试这个...
      • 我也在使用 SRILM,请查看我的第一个编辑帖子。你知道 SRILM 使用的女巫格式吗?
      • 如果您使用的是 SRILM,请执行 www-speech.sri.com/projects/srilm/manpages/srilm-faq.7.html Section B6 中提到的流程。试试看告诉我。
      猜你喜欢
      • 1970-01-01
      • 2015-07-14
      • 1970-01-01
      • 1970-01-01
      • 2016-03-12
      • 2019-02-27
      • 2016-09-22
      • 2019-07-17
      • 1970-01-01
      相关资源
      最近更新 更多