【发布时间】:2020-04-10 23:30:10
【问题描述】:
我的任务是为评论数据集创建分类器模型。我有 15000 次训练观察、5000 次开发和 5000 次测试。
任务指定需要使用 3 个功能:我使用了TFIDF(那里有 5000 个功能)、BOW(更多功能)和review length(更多功能)。因此,例如,我的 X_train 是一个形状为 (15000,7001) 的数组。
我正在调查,发现词嵌入(尤其是word2vec)可能是 BOW 的一个不错的替代方案。
我的问题是,除了我的其他功能之外,它还可以使用(可以与我的其他功能使用相同的“数组”格式吗?)?
我对此进行了一些研究,但没有完全回答我的问题。
【问题讨论】:
标签: python machine-learning scikit-learn text-classification sklearn-pandas