【问题标题】:how to use transformer in huggingface without tokenization?如何在没有标记化的情况下在拥抱脸中使用变压器?
【发布时间】:2022-01-04 18:41:06
【问题描述】:

我有以下代码:

from transformers import AutoTokenizer, AutoModelForTokenClassification, pipeline
tokenizer = AutoTokenizer.from_pretrained("sagorsarker/codeswitch-spaeng-lid-lince")
model = AutoModelForTokenClassification.from_pretrained("sagorsarker/codeswitch-spaeng-lid-lince")
pipeline = pipeline('ner', model=model, tokenizer=tokenizer)
sentence = "some example sentence here"
results = pipeline(sentence)

这很好用。但不是str,我不想传递list 的令牌。我该怎么做?

我想这样做的原因是,我的句子已经被标记化并且简单的" ".join() 不能正确地重现句子。例如,isn't 已被标记为 isn't。但是一个简单的" ".join() 会产生is n't

【问题讨论】:

  • 您最初是如何对输入进行标记化的?
  • 它是由其他研究人员以 CONLL 格式发表的。

标签: nlp tokenize huggingface-transformers huggingface-tokenizers huggingface-datasets


【解决方案1】:

我假设原始数据是由 NLTK 标记的,所以试试NLTK detokenizer

from nltk.tokenize.treebank import TreebankWordDetokenizer
toks = ['hello', ',', 'i', 'ca', "n't", 'feel', 'my', 'feet', '!', 'Help', '!', '!']
twd = TreebankWordDetokenizer()
twd.detokenize(toks)
# "hello, i can't feel my feet! Help!!"

【讨论】:

    猜你喜欢
    • 2022-06-28
    • 2022-01-04
    • 2021-12-12
    • 2020-06-17
    • 2021-08-16
    • 1970-01-01
    • 2021-09-15
    • 2021-01-10
    • 2020-10-26
    相关资源
    最近更新 更多