【问题标题】:How padding in huggingface tokenizer works?拥抱面标记器中的填充如何工作?
【发布时间】:2022-01-01 03:53:29
【问题描述】:

我尝试了以下标记化示例:

tokenizer = BertTokenizer.from_pretrained(MODEL_TYPE, do_lower_case=True)
sent = "I hate this. Not that.",        
_tokenized = tokenizer(sent, padding=True, max_length=20, truncation=True)
print(_tknzr.decode(_tokenized['input_ids'][0]))
print(len(_tokenized['input_ids'][0]))

输出是:

[CLS] i hate this. not that. [SEP]
9

注意参数tokenizer:max_length=20。如何让 Bert tokenizer 将 11 个 [PAD] 标记附加到这句话中,使其总数为 20

【问题讨论】:

    标签: nlp huggingface-transformers bert-language-model transformer huggingface-tokenizers


    【解决方案1】:

    应该设置padding="max_length":

    _tokenized = tokenizer(sent, padding="max_length", max_length=20, truncation=True)
    

    【讨论】:

      猜你喜欢
      • 2020-10-26
      • 2022-01-04
      • 1970-01-01
      • 2020-09-30
      • 1970-01-01
      • 1970-01-01
      • 2020-07-22
      • 2022-08-15
      • 1970-01-01
      相关资源
      最近更新 更多