【问题标题】:StackOverflow Tags Predictor…Suggest an Machine Learning Approach please? [closed]StackOverflow 标签预测器……请推荐一种机器学习方法? [关闭]
【发布时间】:2015-09-01 06:21:22
【问题描述】:

我正在尝试预测 stackoverflow 问题的标签,但我无法确定哪种机器学习算法将是解决此问题的正确方法。

输入:作为我挖掘 stackoverflow 问题的数据集,我对数据集进行了标记化,并从该数据中删除了停用词和标点符号。

我尝试过的事情:

  1. TF-IDF
  2. 在数据集上训练朴素贝叶斯,然后提供用户定义的输入来预测标签,但它不能正常工作
  3. 线性支持向量机

我应该使用有监督或无监督的 ML 算法?如果可能,请从头开始建议正确的 ML 方法。 PS:我有 StackOverflow 上所有标签的列表,无论如何这会有帮助吗?谢谢

【问题讨论】:

  • 不可能也得到标签,然后将集合分成两部分,用一部分训练,用另一部分验证?
  • 已经在朴素贝叶斯中这样做了!

标签: machine-learning prediction text-classification


【解决方案1】:

我会尝试 MLP。为了开始,我会选择一组相当小的关键字作为输入并对它们进行编码[例如 1..100] 并训练一组相当小的输出标签。

PS:无监督学习对于这项任务通常是不利的,因为许多引用不同标签的问题具有非常相似的内容,并且很可能聚集在一起。

【讨论】:

    猜你喜欢
    • 2022-12-11
    • 2012-03-17
    • 2019-06-13
    • 1970-01-01
    • 1970-01-01
    • 2012-03-27
    • 1970-01-01
    • 2023-03-04
    • 1970-01-01
    相关资源
    最近更新 更多