【发布时间】:2020-09-13 04:00:41
【问题描述】:
在 Keras 中,我们有 keras.preprocessing.text 来标记我们要求的文本并生成词汇表。
tokenizer = tf.keras.preprocessing.text.Tokenizer(split=' ', oov_token=1)
tokenizer.fit_on_texts(["Hello world"])
seqs = tokenizer.texts_to_sequences(["Hello world"])
如果我们在填充后将生成的 seqs 馈送到像 RNN 这样的神经网络,我不确定是否要显式添加序列结束 (EOS) 标记和序列开始 (BOS) 标记seq 为固定长度。或者,Keras 是为我们做的吗? (我没有看到任何使用 Keras 分词器时明确添加 EOS 和 BOS 的示例)
【问题讨论】:
标签: python tensorflow keras recurrent-neural-network vocabulary