【发布时间】:2018-12-19 15:38:11
【问题描述】:
我正在尝试使用 Python 对歌曲歌词进行情感分析。 在研究了许多简单的分类问题后,已知标签(例如电子邮件分类垃圾邮件/非垃圾邮件),我认为歌词情感分析位于分类字段。 在实际编码时,我发现我必须计算每首歌曲歌词的情绪,并且可能会在原始数据集中添加一列,将其标记为正面或负面,或者使用实际的情绪分数。
这不能使用集群方法来完成吗?由于我们一开始并不知道每首歌曲的类别(正面情绪/负面情绪),因此算法将使用情绪分析对数据进行聚类。
【问题讨论】:
-
1.如果您没有标签,那么您别无选择,只能进行聚类 2. 您可以使用余弦相似度方法将相似的歌曲聚类在一起 3. 这种方法的效果取决于您的数据集和其他预处理步骤,如标记化等..顺便说一句,您使用的是哪个数据集
-
我正在使用这个数据集。 kaggle.com/mousehead/songlyrics
标签: machine-learning classification cluster-analysis sentiment-analysis