【发布时间】:2013-04-12 09:47:52
【问题描述】:
我试图找出 C4.5 算法如何确定数字属性的阈值。我已经研究过并且无法理解,在大多数地方我都找到了这些信息:
训练样本首先根据所考虑的属性 Y 的值进行排序。这些值的数量是有限的,所以让我们按排序顺序将它们表示为 {v1,v2, ...,vm}。 任何介于 vi 和 vi+1 之间的阈值将具有相同的效果,将案例划分为属性 Y 的值在 {v1, v2, ..., vi} 中的案例和属性 Y 的值在 {vi+1, vi} 中的案例+2,……,vm}。因此 Y 上只有 m-1 个可能的分裂,所有这些都应该系统地检查以获得最佳分裂。
通常选择每个区间的中点:(vi +vi+1)/2 作为代表阈值。 C4.5 为每个区间 {vi, vi+1} 选择一个较小的值 vi 作为阈值,而不是中点本身。
我正在研究 Play/Dont Play (value table) 的示例,但不明白当状态为晴天时,您如何获得属性湿度的数字 75 (tree generated),因为湿度值阳光充足的州是 {70,85,90,95}。
有人知道吗?
【问题讨论】:
-
图的链接已损坏。
标签: artificial-intelligence weka decision-tree