【发布时间】:2022-10-04 23:30:58
【问题描述】:
我有一个文本分类问题。数据集高度不平衡。在训练数据上,我尝试过下采样,使用SMOTE进行上采样,但性能并不好。我正在努力达到 0.80 的 F1 分数 下面是使用 Glove 嵌入和 ADABoost 分类器的性能。尝试使用 SVM 进行通用句子编码,性能稍好:
precision recall f1-score support
0 0.9381 0.6841 0.7912 9904
1 0.1813 0.6079 0.2793 1140
accuracy 0.6762 11044
macro avg 0.5597 0.6460 0.5353 11044
我也尝试过 bert 微调模型,但并没有太大的不同。我相信由于测试数据集不平衡,精度确实很低。我还能尝试什么来提高性能?
【问题讨论】:
标签: machine-learning nlp data-science imbalanced-data