【问题标题】:Supervised learning by creating own labels通过创建自己的标签进行监督学习
【发布时间】:2019-11-08 23:01:22
【问题描述】:

场景 - 我有没有标签的数据,但我可以创建一个函数来根据行为标记数据并部署模型,这样我就不必一直标记数据。这算不算机器学习?

目标:根据高、中低标签对容量峰值的帐户进行分类,以部署在大数据(数万亿行数据)上

数据:我拥有的数据包括以下属性: 帐户、时间、日期、交易量。

方法

  1. 创建一个名为“spike”的新特征列,并创建一个 pandas 函数来识别大于 5 的尖峰。这是特征工程吗?

  2. 接下来我创建我的标签列并将其分类为低中或高尖峰。

  3. 接下来,我训练一个机器学习分类器并将其部署为在大数据中使用类似模式标记未来的帐户。

对这个过程有什么想法?这种方法适用于机器学习吗?

【问题讨论】:

  • 好笑,最近,一堆论文把这个场景当作自我监督……

标签: machine-learning


【解决方案1】:

第一个问题: 如果您的算法做出决定,即根据您拥有的样本集在样本中放置标签,我会说这是一种机器学习算法。但是,如果您设计的代码考虑到您对数据的经验,我认为这不是 ML 方法。简而言之,ML 查看数据以从中获取模式和见解。我不知道你为什么这样做,但它需要是一个 ML 算法吗?有时你可以用一种非常简单的方式解决问题,而无需使用 ML。

第二个问题:恐怕不会。选择您的数据属性(例如:帐户、时间、日期、数量),检查它们的相关性,尝试找出您是否有一个占主导地位的属性,等等。这个过程是 ML 之前的。特征工程将选择最好的特征呈现给我们的算法以执行分类(在您的情况下)

第三个问题:我认为开始玩一些 ML 算法已经足够公平了,例如 KNN、SVM、NNs、决策树等。

【讨论】:

    猜你喜欢
    • 2017-06-15
    • 2017-02-28
    • 2014-04-20
    • 2018-11-16
    • 2013-03-24
    • 2016-07-28
    • 2021-10-17
    • 2015-06-01
    • 2019-02-20
    相关资源
    最近更新 更多