【发布时间】:2019-06-21 17:51:48
【问题描述】:
我正在对法语文本数据使用 bert 嵌入。我在加载模型和词汇时遇到问题。
我使用以下代码进行标记化,效果很好,但为了获得词汇,它给了我中文单词!!
tokenizer = BertTokenizer.from_pretrained('bert-base-multilingual-cased')
text = "La Banque Nationale du Canada fête cette année le 110e anniversaire de son bureau de Paris."
marked_text = "[CLS] " + text + " [SEP]"
tokenized_text = tokenizer.tokenize(marked_text)
list(tokenizer.vocab.keys())[5000:5020]
我希望词汇表中有法语单词,但我得到了中文单词,我应该在代码中的某处指定语言吗?
【问题讨论】:
-
据我所知,无法指定语言。
标签: python pytorch multilingual bert-language-model