【发布时间】:2016-09-15 07:10:06
【问题描述】:
我正在尝试使用斯坦福情绪分析数据集进行一些情绪分析研究。我下载了数据集enter link description here 来自http://nlp.stanford.edu/sentiment/index.html。看完readme文件,我还是有些疑惑。
第一个问题,在dictionary.txt文件的“50446”行,显示这句话的“phrase ids”是“No.226166”,所以当我在sentiment_lable.txt文件中搜索,在“226168”行中,“No.226166”短语的“sentiment values”为0.69444强>。但是在dictionary.txt 文件的“50445”行中,这句话等同于“50446”行中的句子。但是这句话在sentiment_lable.txt文件中有不同的“情感值”,为什么?!!!
第二个问题,在一些情感分析论文中,他们不仅在训练句子中使用全长句子来训练模型,而且还使用作为训练句子子部分出现的标记短语来训练模型.但是我在 dictionary.txt 文件中发现了一些无用的短语,例如第 2 行和第 3 行,我应该使用这些无用的短语来训练我的模型吗?
【问题讨论】:
标签: nlp stanford-nlp deep-learning sentiment-analysis recurrent-neural-network