【问题标题】:Recommendations for text classification models to work with almost 200K labels建议使用近 20 万个标签的文本分类模型
【发布时间】:2019-11-08 05:48:32
【问题描述】:

所以基本上我想对很多标签(200K+)进行分类。 是否有任何推荐的模型我应该尝试以获得相对较好的准确性并且不需要数天才能完成?

我曾尝试使用 Sklearn 的 OneVsRestClassifier 进行线性回归,但我将它放置了一夜,但仍然没有完成拟合

我相信应该有更高效的 NLP 多类分类算法

提前致谢

【问题讨论】:

  • 欢迎来到 SO;请花一些时间阅读What topics can I ask about here?,并注意要求我们推荐或查找书籍、工具、软件库、教程或其他场外资源的问题与 SO 无关。

标签: python machine-learning scikit-learn nlp


【解决方案1】:

鉴于您拥有的数据量,请考虑多项式朴素贝叶斯。 Sklearn 有一个非常直接的实现:https://scikit-learn.org/stable/modules/generated/sklearn.naive_bayes.MultinomialNB.html 这将比使用神经网络更快。一个简单模型上的大量训练数据总是比具有较少数据的大型模型具有更强的预测能力。

【讨论】:

  • 谢谢你的建议,我会试试的
猜你喜欢
  • 2022-07-10
  • 2019-07-29
  • 2015-12-16
  • 2019-12-17
  • 2016-05-25
  • 2016-10-19
  • 2016-06-14
  • 2018-08-16
  • 2017-01-22
相关资源
最近更新 更多