【问题标题】:Binary classification of webpages where data in categories are very similar类别中的数据非常相似的网页的二进制分类
【发布时间】:2014-01-04 04:30:43
【问题描述】:

我正在对与我感兴趣的主题相关的网页进行二元分类。我想对网页是否属于某个类别进行分类。我手动标记了具有 2 个类别 positivenegative 的数据集。但是,我担心的是,当我查看每个类别的词袋时,它们的特征非常相似。 positivenegative 网页确实非常接近(内容方面)。

更多信息 - 内容为英文,我们也在移除停用词。

我该如何完成这项任务?是否有不同的方法可以应用于这个问题? 谢谢!

【问题讨论】:

  • 您能想到任何其他功能可以让它们与众不同吗?您将它们归入每个类别的个人标准是什么?学习算法可能能够“凑合”使用狭窄的分离,但您可能会遇到很多误报和误报。
  • 这就是我现在得到的......很多误报。这些网页是由专家划分的,但主要是根据他们是否谈论某个话题。就我而言,负面网页主要是将页面转发到正面网页。我目前正在深入研究以找到可以将这两个类别分开的其他内容。
  • 另外,我正在抓取仅限于我感兴趣的主题的页面,这已经在一定程度上限制了噪音
  • 啊,你是要筛选出“blogspam”吗?您可以尝试添加其他功能,例如文章长度、页面上的广告数量、文章中的链接数量等。除非您说明您的问题,否则我认为您不会在 StackOverflow 上得到具体的答案有更多细节。
  • @aganders3 不是“博客垃圾邮件”。主要是与科学研究有关的网站。您提到的某些功能可能很有用,从您的经验来看,这些功能不再是这些功能。将尝试。谢谢!

标签: machine-learning classification


【解决方案1】:

您可以使用成对的连续词而不是单个词(成对词袋)。希望这对单词可以更好地捕捉您所追求的概念。接下来可能会出现三个单词。问题是维度非常高(N^2)。如果你买不起,一个想法是在成对的单词上使用散列技巧(检查关于随机投影/散列的文献)来限制维度。

【讨论】:

    猜你喜欢
    • 2017-09-25
    • 2019-07-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-09-26
    • 2022-01-12
    • 2013-08-15
    相关资源
    最近更新 更多