【问题标题】:How to save a tokenizer after training it?训练后如何保存分词器?
【发布时间】:2021-10-16 01:07:47
【问题描述】:

我刚刚按照this 教程学习了如何训练我自己的分词器。

现在,通过训练我的标记器,我将它包装在一个 Transformers 对象中,以便我可以将它与转换器库一起使用:

from transformers import BertTokenizerFast

new_tokenizer = BertTokenizerFast(tokenizer_object=tokenizer)

然后,我尝试使用以下代码保存我的标记器:

tokenizer.save_pretrained('/content/drive/MyDrive/Tokenzier')

但我收到此错误:

AttributeError: 'tokenizers.Tokenizer' object has no attribute 'save_pretrained'

我是否错误地保存了分词器?

如果是这样,将它保存到我的本地文件的正确方法是什么,以便我以后可以使用它?

【问题讨论】:

  • 不应该是new_tokenizer 而不是tokenizer
  • 我已经成功使用tokenizer.save(directory + "/" + fname)了。

标签: python machine-learning bert-language-model huggingface-transformers huggingface-tokenizers


【解决方案1】:

BertTokenizerFast 的文档建议使用 _save_pretrained()

请看这里:https://huggingface.co/transformers/model_doc/bert.html#transformers.BertTokenizerFast.save_vocabulary

【讨论】:

    猜你喜欢
    • 2022-10-17
    • 2020-02-13
    • 2019-11-17
    • 2016-02-18
    • 2016-07-28
    • 2021-11-23
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多