【发布时间】:2022-08-23 21:50:17
【问题描述】:
我注意到,如果我对包含许多句子的全文进行标记,有时会得到不同数量的标记,而不是单独标记每个句子并将标记加起来。我已经做了一些调试,并有这个可重现的小例子来说明问题
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained(\'facebook/bart-large-cnn\')
print(tokenizer.tokenize(\"Thames is a river\"))
print(tokenizer.tokenize(\"We are in London. Thames is a river\"))
我得到以下输出
[\'Th\', \'ames\', \'Ġis\', \'Ġa\', \'Ġriver\']
[\'We\', \'Ġare\', \'Ġin\', \'ĠLondon\', \'.\', \'ĠThames\', \'Ġis\', \'Ġa\', \'Ġriver\']
我想了解为什么 Thames 这个词在序列的开头被分成两个标记,而如果它不在序列的开头,它就是一个单词。我注意到这种行为非常频繁,假设它不是错误,我想了解为什么 BART 标记器会这样。
非常感谢
标签: nlp huggingface-transformers bert-language-model huggingface-tokenizers bart