【发布时间】:2016-05-17 00:26:28
【问题描述】:
我下载了流行的 20 个新闻组数据集,它有 20 个类,但我想将整个文档重新分类为 6 个类,因为有些类非常相关。
例如,所有与计算机相关的文档都应该有一个新的类,比如 1。就像现在一样,文档从 1 到 20 分配,反映了这些类。计算机相关的类有2、3、4、5、6。
我想说,1 是所有与计算机相关的类(2,3,4,5,6)。我使用20_newsgroups.target[0] 对其进行了测试,它给了我 7。这意味着 0 处的文档的类是 7。
我使用 20_newsgroups.target[0]='1' 将它重新分配给一个新类,当我尝试 20_newsgroups.target[0] 时,它显示 1 可以。
但是我怎样才能对当前以 (2,3,4,5,6) 为类的所有文档执行此操作?如果我理解它,我可以很容易地将它扩展到其他类。我也尝试在 20_newsgroups 中使用 d:
if 20_newsgroups.target in [2,3,4,5,6], 20_newsgroups.target='1'.
但这显示了一个错误,即“具有多个元素的数组的真值是明确的,请使用 a.any() 或 a.all”。
【问题讨论】:
标签: python scikit-learn nlp