【问题标题】:BERT with 256 hidden embeddings具有 256 个隐藏嵌入的 BERT
【发布时间】:2023-03-07 10:19:01
【问题描述】:

我正在尝试使用 BERT 从不同的数据集中为我的 NLP 任务获取词嵌入。我使用了带有 768 个词嵌入的“bert_base_uncased”,但内存不足。有 256 个词嵌入的版本已经发布了吗?或者有什么方法可以压缩 768 个隐藏的嵌入? 谢谢!

【问题讨论】:

    标签: python tensorflow pytorch bert-language-model


    【解决方案1】:

    我不太确定 BERT 的 256 个词嵌入版本,但我知道较新的 ALBERT 与 BERT 相比使用的内存要少得多。此外,如果您经常面临 OOM 问题,您可以尝试查看 16 位精度训练或混合精度训练。这适用于较新的 RTX 卡(以及其他一些卡,但不适用于较旧的 GPU)

    Nvidia 有一个library,但它对初学者不太友好,或者您也可以考虑使用Pytorch Lightning 将您的模型转换为 16 位。

    【讨论】:

    猜你喜欢
    • 2020-08-29
    • 1970-01-01
    • 2011-01-07
    • 2021-05-06
    • 2020-01-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-01-16
    相关资源
    最近更新 更多