【发布时间】:2021-08-04 04:16:03
【问题描述】:
tokenizer add_tokens 没有添加新的令牌。 这是我的代码:
from transformers import BertTokenizer
bert_tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
new_tokens = []
text = open("parsed_data.txt", "r")
for line in text:
for word in line.split():
new_tokens.append(word)
print(len(new_tokens)) # 53966
print(len(bert_tokenizer)) # 36369
bert_tokenizer.add_tokens(new_tokens)
print(len(bert_tokenizer)) # 36369
【问题讨论】:
-
我发现了这个问题。其实没有问题。它没有更新 bert_tokenizer,因为所有词汇都已经存在于 bert_tokenizer 中。
标签: python nlp pytorch bert-language-model