【问题标题】:How to use Stanford Sentiment Analysis Dataset如何使用斯坦福情绪分析数据集
【发布时间】:2016-09-15 07:10:06
【问题描述】:

我正在尝试使用斯坦福情绪分析数据集进行一些情绪分析研究。我下载了数据集enter link description here 来自http://nlp.stanford.edu/sentiment/index.html。看完readme文件,我还是有些疑惑。

第一个问题,在dictionary.txt文件的“50446”行,显示这句话的“phrase ids”是“No.226166”,所以当我在sentiment_lable.txt文件中搜索,在“226168”行中,“No.226166”短语的“sentiment values”为0.69444强>。但是在dictionary.txt 文件的“50445”行中,这句话等同于“50446”行中的句子。但是这句话在sentiment_lable.txt文件中有不同的“情感值”,为什么?!!!

第二个问题,在一些情感分析论文中,他们不仅在训练句子中使用全长句子来训练模型,而且还使用作为训练句子子部分出现的标记短语来训练模型.但是我在 dictionary.txt 文件中发现了一些无用的短语,例如第 2 行和第 3 行,我应该使用这些无用的短语来训练我的模型吗?

【问题讨论】:

    标签: nlp stanford-nlp deep-learning sentiment-analysis recurrent-neural-network


    【解决方案1】:

    dictionary.txt文件的格式是

    <Phrase>|<ID>
    

    sentiment_labels.txt的格式是

    <Phrase ID>|<Score>
    

    例如

    id: 50445 phrase: control of both his medium and his message
    score: .777
    
    id: 50446 phrase: controlled display of murderous vulnerability ensures that malice has a very human face
    score: .444
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-04-30
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-07-05
      相关资源
      最近更新 更多