【发布时间】:2019-11-26 08:52:27
【问题描述】:
我们知道预测和分类问题可以根据训练比率(通常为 70-30 或 80-20 拆分)破坏数据,其中训练数据被传递给模型以进行拟合,并针对测试对其输出进行测试数据。
假设我有一个包含 2 列的数据:
- 第一列:员工年龄
- 第二栏:员工薪资类型
有 100 条类似的记录:
Employee Age Employee Salary Type
25 low
35 medium
26 low
37 medium
44 high
45 high
如果训练数据按 70:30 的比例拆分,
设目标变量为Employee Salary Type,预测变量为Employee Age
数据在 70 条记录上进行了训练,并针对剩余的 30 条记录进行了测试,同时隐藏了它们的目标变量。
假设 30 条记录中有 25 条预测准确。
Accuracy of the model = (25/30)*100 = 83.33%
这意味着模型很好
让我们将同样的事情应用到像聚类这样的无监督学习中。
这里没有目标变量,只有集群变量。
让我们将Employee age 和Employee Salary 都视为集群变量。
然后数据会根据自动聚类
Employees with low age and low salary
Employees with medium age and medium salary
Employees high age and high salary
如果在此处应用训练比率,我们可以对 70 条随机记录进行聚类,并使用剩余的 30 条记录来测试/验证上述模型,而不是使用其他一些数据(及其记录)进行测试。 这里我们需要对拟合 70% 的记录进行建模,然后再次对剩余 30% 的记录进行建模,因此我们需要比较 70% 数据的集群 1 的特征和剩余 30% 数据的集群 1 的特征。如果特征相似,那么我们可以得出聚类模型良好的推断。
因此在这里可以准确地测量精度。
为什么人们不喜欢训练/测试/拆分来进行无监督分析,如聚类、关联规则、预测等。
【问题讨论】:
-
您在“为什么人们不喜欢...”中指的是哪些人?
-
不是编程问题,因此这里可以说是题外话;更适合Cross Validated。
-
你听起来很困惑;在您的第二个示例中,甚至不存在准确性的概念(更不用说可测量了)
标签: machine-learning cluster-analysis unsupervised-learning