【问题标题】:can we use autoencoders for text data我们可以对文本数据使用自动编码器吗
【发布时间】:2016-02-21 01:09:04
【问题描述】:

我正在做基于医疗保健的项目。我将用症状和疾病训练我的自动编码器,即我的输入是文本形式的。那行得通吗? (我正在使用 Rstudio)。请任何人帮助我

【问题讨论】:

  • 欢迎来到 SO。但是,正如所写,您的问题过于广泛。请尝试一下,遇到困难时再回来。

标签: autoencoder


【解决方案1】:

您必须将文本转换为矢量/数字。要执行此传统方法(如 Bag of words),Tf-Idf 将有所帮助,但最新的神经词嵌入(如 Word2Vec、RNN 语言模型等)是获得文本数字表示的最佳技术。 请使用任何神经词嵌入技术并将文本(词level[word2vec], document level[doc2vec]) 转换为数字/向量。 现在这些向量带有一些维度,并且要将这个表示压缩到更小的维度,你可以使用 AutoEncoder。 随时询问所需的任何其他信息。 尝试使用 Python 来完成这些任务,因为它有最新的软件包。

【讨论】:

  • 您是否发现将自动编码器应用于矩阵时会出现问题,该矩阵包含与其他连续特征(如年龄或其他计数)连接的词袋表示?
【解决方案2】:

您可以按照here 的说明对文本数据使用自动编码器。

自动编码器通常在图像数据上效果更好,但最近的方法改变了自动编码器,使其在文本数据上也很好。

看看this

代码也可以在 GitHub 中找到。

【讨论】:

    猜你喜欢
    • 2019-09-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-01-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多