【发布时间】:2016-10-02 23:18:46
【问题描述】:
我在一个对象被分类为 A 或 B 的数据集上运行 knn(在 R 中)。但是,A 的数量比 B 的多(每 1 个 B 类,A 类 18 个)。
我应该如何解决这个问题?例如,如果我使用 18 的 ak,并且邻居中有 7 个 B(比一组 18 个中的平均 B 多得多),那么测试数据仍然会被归类为 A,而应该是 B。
我认为较低的 k 会对我有所帮助。选择 k 的值是否有任何经验法则,因为它与训练集中类的频率有关?
【问题讨论】:
标签: r classification knn