【问题标题】:add training data to existing LinearSVC将训练数据添加到现有的 LinearSVC
【发布时间】:2016-12-23 08:52:40
【问题描述】:

我正在抓取大约 200,000 个网站,寻找发布在小型企业网站上的某些类型的媒体。我有一个腌制的linearSVC,我已经训练它来预测在网页上找到的链接包含我正在寻找的类型的媒体的概率,并且它表现得相当好(总体准确度约为95%)。但是,我希望刮板在刮板时定期用新数据更新分类器。

所以我的问题是,如果我加载了一个腌制的 sklearn LinearSVC,有没有办法在不重新训练整个模型的情况下添加新的训练数据?还是我必须加载所有以前的训练数据,添加新数据,然后训练一个全新的模型?

【问题讨论】:

    标签: python machine-learning scikit-learn


    【解决方案1】:

    您无法将数据添加到 SVM 并获得与将其添加到原始训练集相同的结果。您可以从以前的解决方案开始使用扩展训练集重新训练(应该更快),或者只训练新数据并完全偏离以前的解决方案。

    只有少数模型可以在这里实现您想要实现的目标 - 例如岭回归或线性判别分析(以及它们的内核化 - 内核岭回归或内核 Fischer 判别,或“极端”对应物 - ELM 或EEM),它具有能够“动态”添加新训练数据的特性。

    【讨论】:

    • 您提到的模型能否用作良好的二进制文本分类器,它们的准确性是否可以与 SVC 相媲美?谢谢!
    • 它们都可以用作二进制分类器,并且在某些问题上它们会比 svm 更强大。 Nlp 是一个非常具体的领域(非常内部化),您可以自行检查。还有天真的贝叶斯哈这个属性
    猜你喜欢
    • 2021-10-24
    • 2021-12-08
    • 2016-11-26
    • 1970-01-01
    • 1970-01-01
    • 2013-10-23
    • 1970-01-01
    • 1970-01-01
    • 2019-11-26
    相关资源
    最近更新 更多