【问题标题】:Feature Extraction Using Representation Learning使用表示学习进行特征提取
【发布时间】:2021-04-06 04:41:08
【问题描述】:

我是机器学习的新手,我接到了一项任务,要求我使用表示学习(例如堆叠式自动编码器)从具有连续数据的数据集中提取特征。

然后我将这些提取的特征与数据集的原始特征结合起来,然后使用特征选择技术来确定我的最终特征集,这些特征将进入我的预测模型。

谁能告诉我一些资源或演示或示例代码,我可以如何开始这方面的工作?我很困惑从哪里开始,希望得到一些建议!

【问题讨论】:

    标签: python feature-extraction feature-selection feature-engineering


    【解决方案1】:

    好的,假设您有一个输入(1000 个实例和 30 个特征)。根据你告诉我们的,我会做的是:

    训练一个自动编码器,一个压缩输入然后解压缩的神经网络,它以您的原始输入为目标。压缩表示位于潜在空间中,并封装了人类无法直接访问的有关输入的信息。现在你可能会在 tensorflow 或 pytorch 中找到这样的网络。 Tensorflow 更简单、更直接,因此对您来说可能会更好。我将提供此链接 (https://keras.io/examples/generative/vae/) 用于可能为您完成这项工作的变分自动编码器。它具有 Conv2D 层,因此它对图像数据的性能非常好,但您可以使用该架构。我不能告诉你更多,因为你没有为你的数据集提供更多信息。但是,重要的是:

    在您的自动编码器经过正确训练并且您需要确保它(它充分重构输入)之后,您需要提取上述潜在输入(您将在链接中找到更多信息)。现在,假设是 16 个数字,但您可以使用它。这 16 个数字旨在保存有关您输入的信息。你说你想将这些数字与你的输入结合起来,所以不妨这样做并最终得到 46 个输入特征。现在,特征选择部分与选择对您的模型更有用的输入特征有关。这不是很有趣,您可能会找到更多信息 (https://towardsdatascience.com/feature-selection-techniques-in-machine-learning-with-python-f24e7da3f36e),选择特征的一种方法是训练具有不同特征子集的许多模型。请记住,诸如 PCA 之类的技术是用于特征提取而不是选择。我无法提供任何可以完成全部工作的演示,但有一些资源可以提供帮助。请记住,您的自动编码器应该为每个训练示例返回 16 个数字。您的自动编码器仅根据您的训练数据进行训练,并以您的训练数据作为目标。

    【讨论】:

      猜你喜欢
      • 2021-05-12
      • 2023-03-16
      • 2019-06-07
      • 2020-08-06
      • 2012-10-19
      • 1970-01-01
      • 2020-07-23
      • 1970-01-01
      • 2013-08-15
      相关资源
      最近更新 更多