【问题标题】:CoreNLP Training Model IssueCoreNLP 训练模型问题
【发布时间】:2015-11-25 16:25:15
【问题描述】:

我正在使用 Stanford CoreNLP 对我收集的一些推文执行情绪分析。我用一句话创建了一个模拟训练模型,评分如下: (0 (2 熊市)(2 (2 石油)(2 市场)))。

我的评分范围是 0 到 4,0 表示非常消极,2 表示中立,4 表示非常积极。 我正在测试以下两条推文:

熊市

熊市

它给第一个句子赋值为0,这是正确的,第二个句子被评分为2,这是不正确的,因为这句话也应该是否定的。两个句子之间的唯一区别是第二句中的市场 s。

我的问题是:有什么方法可以解决任何单词的任何变化都会导致两个句子得分不同的事实?

【问题讨论】:

    标签: stanford-nlp sentiment-analysis scoring


    【解决方案1】:

    我认为简短的回答是“不”——措辞的不同总是有可能改变句子的情绪。您可以尝试通过重新训练新数据来缓解问题。

    真的,如果您运行的不是电影评论,那么您应该预计模型的性能至少会下降一点,偶尔会下降很多。如果您有训练数据,则值得重新训练。

    【讨论】:

      【解决方案2】:

      实际上,您可以通过将每个单词替换为其词根或“词干”形式的语言方法来解决此问题。你过滤每个句子并减少每个单词,去掉复数、动词结尾、形容词变格等。然后你训练。

      您以同样的方式过滤您的输入。您仍然需要对您的词典做出一些决定,例如是否将“最佳”降低为“好”。

      【讨论】:

        猜你喜欢
        • 2016-02-16
        • 1970-01-01
        • 1970-01-01
        • 2020-08-30
        • 1970-01-01
        • 2016-02-10
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多