【发布时间】:2021-07-27 21:07:45
【问题描述】:
假设我有一些文本,我想将它们分为三组food, sports, science。如果我有一个句子 I dont like to each mushrooms,我们可以使用 wordembedding(比如 100 维)为这个特定的句子创建一个 6x100 矩阵。
通常在训练神经网络时,我们的数据是二维数组,维度为n_obs x m_features
如果我想在词嵌入句子上训练神经网络(我正在使用 Pytorch),那么我们的输入是 3D n_obs x (m_sentences x k_words)
例如
#Say word-embedding is 3-dimensions
I = [1,2,3]
dont = [4,5,6]
eat = [7,8,9]
mushrooms = [10,11,12]
"I dont eat mushrooms" = [I,dont,eat,mushrooms] #First observation
当我们有 N>2 维时,最好的方法是进行某种池化,例如均值,还是我们可以使用实际的 2D 特征作为输入?
【问题讨论】:
标签: neural-network nlp pytorch text-classification