【发布时间】:2017-09-25 05:32:15
【问题描述】:
我正在尝试对一组彼此非常相似的句子进行二元分类任务。我的问题是我不确定如何处理样本之间如此相似的问题。以下是我的一些问题:
(1)。在这种情况下,哪种分类技术更适合?
(2)。在这种情况下,特征选择会有所帮助吗?
(3)。基于循环神经网络 (LSTM) 的序列分类算法能否成为一种潜在的方法?
很高兴看到有关此问题的任何提示或帮助,谢谢!
【问题讨论】:
-
我很惊讶!为什么要减分?这个问题有什么问题?也许我需要考虑聚类算法而不是分类算法?
-
我猜评分是因为这类问题不适合 SO,请参阅guidelines。我建议你试试Cross Validated
-
谢谢@ncfirth!我换了话题。
-
什么是'如此相似'?这个问题没有任何意义......
-
@Anony-Mousse 正如上面所解释的,“如此相似”是指代表数据集样本的句子。
标签: machine-learning scikit-learn classification text-classification