【发布时间】:2020-09-29 17:53:38
【问题描述】:
我使用tensorflow.keras.preprocessing.text 中的Tokenizer() 函数作为:
from tensorflow.keras.preprocessing.text import Tokenizer
s = ["The quick brown fox jumped over the lazy dog."]
t = Tokenizer()
t.fit_on_texts(s)
print(t.word_index)
输出:
{'the': 1, 'quick': 2, 'brown': 3, 'fox': 4, 'jumped': 5, 'over': 6, 'lazy': 7, 'dog': 8}
Tokenizer 功能不包括标点符号。如何标记标点符号? (.,在这个例子中。)
【问题讨论】:
标签: python tensorflow keras nlp tokenize