【发布时间】:2014-01-04 04:30:43
【问题描述】:
我正在对与我感兴趣的主题相关的网页进行二元分类。我想对网页是否属于某个类别进行分类。我手动标记了具有 2 个类别 positive 和 negative 的数据集。但是,我担心的是,当我查看每个类别的词袋时,它们的特征非常相似。 positive 和 negative 网页确实非常接近(内容方面)。
更多信息 - 内容为英文,我们也在移除停用词。
我该如何完成这项任务?是否有不同的方法可以应用于这个问题? 谢谢!
【问题讨论】:
-
您能想到任何其他功能可以让它们与众不同吗?您将它们归入每个类别的个人标准是什么?学习算法可能能够“凑合”使用狭窄的分离,但您可能会遇到很多误报和误报。
-
这就是我现在得到的......很多误报。这些网页是由专家划分的,但主要是根据他们是否谈论某个话题。就我而言,负面网页主要是将页面转发到正面网页。我目前正在深入研究以找到可以将这两个类别分开的其他内容。
-
另外,我正在抓取仅限于我感兴趣的主题的页面,这已经在一定程度上限制了噪音
-
啊,你是要筛选出“blogspam”吗?您可以尝试添加其他功能,例如文章长度、页面上的广告数量、文章中的链接数量等。除非您说明您的问题,否则我认为您不会在 StackOverflow 上得到具体的答案有更多细节。
-
@aganders3 不是“博客垃圾邮件”。主要是与科学研究有关的网站。您提到的某些功能可能很有用,从您的经验来看,这些功能不再是这些功能。将尝试。谢谢!
标签: machine-learning classification