【发布时间】:2013-04-04 01:48:55
【问题描述】:
我有 N 个文档的语料库,分类为 spam / no-spam。我正在按照标准程序对 R(code here) 中的数据进行预处理。预处理以 DocumenTermMatrix 结束,使用权重作为 tfidf。
现在我想用我的模型对新文档进行分类。
如何计算单个新文档对应的DocumentVector(使用文档的tf和语料库的idfs)?我想避免为整个语料库重新计算DocumentTermMatrix。
【问题讨论】:
标签: r machine-learning nlp classification