【发布时间】:2020-05-16 23:51:08
【问题描述】:
我想在预训练的 Bert 模型上使用 Huggingface Transformers repository 中的 examples/run_lm_finetuning.py。但是,从遵循文档来看,语料库文件的结构并不明显(除了引用 Wiki-2 数据集)。我试过了
- 每行一个文档(多个句子)
- 每行一个句子。文档以空行分隔(我在一些较旧的 pytorch-transformers 文档中找到了这一点)
通过查看examples/run_lm_finetuning.py 的代码,并不能直接看出下一句预测目标的序列对是如何形成的。 --line-by-line 选项在这里有帮助吗?如果有人能给我一些提示,文本语料库文件应该是什么样子,我将不胜感激。
非常感谢和欢呼,
nminds
【问题讨论】:
标签: python pytorch huggingface-transformers bert-language-model