【发布时间】:2021-01-17 09:13:08
【问题描述】:
鉴于这段代码:
from tensorflow.keras.preprocessing.text import Tokenizer
sentences = [
'i love my dog',
'I, love my cat',
'You love my dog!'
]
tokenizer = Tokenizer(num_words = 1)
tokenizer.fit_on_texts(sentences)
word_index = tokenizer.word_index
print(word_index)
无论是num_words=1 还是num_words=100,当我在我的jupyter notebook 上运行这个单元格时,我得到相同的输出,我似乎无法理解它在标记化方面有什么不同。
{“爱”:1,“我”:2,“我”:3,“狗”:4,“猫”:5,“你”:6}
【问题讨论】:
标签: python tensorflow machine-learning keras nlp