【发布时间】:2018-02-04 18:36:52
【问题描述】:
我有一个文本语料库,我想找到从一个字符开始的单词的嵌入。所以我有一个字符序列作为输入,我想将它投影到一个多维空间中。
作为初始化,我想拟合已经学过的词嵌入(例如,谷歌的词嵌入)。
我有一些疑问:
- 是否需要为每个输入使用字符嵌入向量 输入序列中的字符?如果我使用会不会有问题 只是 ascii 或 utf-8 编码?
- 尽管输入是什么 矢量定义(嵌入 vec、ascii、..)这真的很令人困惑 选择合适的型号有几个选项,但我不确定 哪个是更好的选择:seq2seq、自动编码器、lstm、 多回归器+lstm ?
- 你能给我任何示例代码吗 keras 还是 tensorflow?
【问题讨论】:
标签: tensorflow keras lstm autoencoder word-embedding