【发布时间】:2020-11-23 23:00:14
【问题描述】:
假设我有两个标记化的 BERT 序列:
seq1 = tensor([[ 101, 2023, 2003, 1996, 23032, 102]])
seq2 = tensor([[ 101, 2023, 2003, 6019, 1015, 102]])
这是用 huggingface 的分词器生成的:
seq = torch.tensor(tokenizer.encode(text=query, add_special_tokens=True)).unsqueeze(0)
组合标记化序列以获得最终序列的最佳方法是什么,其中 [sep] 标记是自动递增的?
例如:
combined = tensor([[ 101, 2023, 2003, 1996, 23032, 102, 2023, 2003, 6019, 1015,
102]])
似乎我应该循环并增加特殊标记,但这似乎也很老套。
【问题讨论】:
-
是否有必要使用
seq1和seq2或者您也可以使用实际的字符串? -
不理想,不
标签: python tokenize bert-language-model huggingface-transformers