【问题标题】:How to use arabert-v2 completely offline?如何完全离线使用arabert-v2?
【发布时间】:2021-08-22 15:20:37
【问题描述】:

我想离线使用 arabert-v2 预处理。但似乎保存模型对于 arabert 预处理功能是不够的。我还应该下载什么?有什么想法吗?

git 仓库: https://github.com/aub-mind/arabert

【问题讨论】:

    标签: python bert-language-model


    【解决方案1】:

    一旦您下载了模型和标记器,例如:

    model_name = "aubmindlab/aragpt2-mega"
    model = GPT2LMHeadModel.from_pretrained(model_name)
    tokenizer = GPT2TokenizerFast.from_pretrained(model_name)
    

    然后您可以将它们保存在本地:

    model.save_pretrained("../model")
    tokenizer.save_pretrained("../tokenizer")
    

    您可以通过以下方式访问模型:

    model = GPT2LMHeadModel.from_pretrained("./model")
    

    【讨论】:

    • 看来这还不够。库中的贡献者之一 Wissam Antoun 通过电子邮件回答:Arabert v2 和 v1 的预处理器使用 Farasa 分段器包,该包在内部调用 java .jar 文件进行分段。为了离线使用这个包,我认为你需要从这里克隆项目github.com/MagedSaeed/farasapy。然后将包含 farasa jar 的 zip 文件所在的目标位置修改为您已手动下载该 zip 文件的位置。知道我应该怎么做
    猜你喜欢
    • 2019-01-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-01-15
    • 2011-03-30
    相关资源
    最近更新 更多