【问题标题】:NLP: Way to efficiently compare and identify trends between textNLP:有效比较和识别文本之间趋势的方法
【发布时间】:2017-02-22 14:03:23
【问题描述】:

是否有可以评估文本项之间的共同趋势/主题的算法或方法?

例如,假设有四个数据点(文本条目):

  • “我发现今天的学校压力很大”
  • “物理测试非常简单。”
  • “我的物理测试一点儿挑战性都没有”
  • “每个人都早早离开了,因为物理测试很简单,我们提前完成了。”

基于这四个条目,第一个是异常值,与其他条目无关,但其他三个提到“物理测试”很容易(更一般地说,其他三个表达了对“物理测试”的积极情绪")。

有没有办法提取相关句子之间的共同点?这些句子是完全开放式的,并不局限于简单地表达对某个对象的情感——它们可以谈论任何事情。

我知道这是一个相当广泛的问题,但我想我会问一下,看看人们是否知道现有的解决方案或人们过去解决此问题的方法。

【问题讨论】:

    标签: nlp text-mining


    【解决方案1】:

    其中一个可能的解决方案是 - 首先生成句子表示 (Sent2Vec),然后比较这些表示。

    有很多方法可以生成英文句子的句子嵌入。一种流行的方法是skip-though vectors。只需将句子转换为向量,然后使用余弦相似度来比较句子。

    您还可以使用这些句子嵌入来训练神经网络来完成您的目标任务。

    【讨论】:

    • 这看起来很有趣 - 谢谢!看来 Sent2Vec 过程将有助于完成我任务的第一部分 - 但我也在寻找一种方法来实际识别句子之间的具体关系(即它们都引用“物理测试”和形容词“简单”)
    • @abagshaw 然后你需要句子解析和提取名词短语,然后生成短语嵌入并比较它们所有可能的对。你应该有一些直觉来识别关键字之间的关系!
    • 这就是我的想法......但我不确定这是否能够扩展到比较数万/数十万个句子。
    • @abagshaw 这取决于模型设计。如果你有更多的例子,那是个好消息,因为你可以训练一个深度神经模型来完成你的目标任务!
    猜你喜欢
    • 2014-05-27
    • 1970-01-01
    • 2014-07-30
    • 1970-01-01
    • 2020-11-12
    • 2018-05-18
    • 1970-01-01
    • 2019-07-17
    • 1970-01-01
    相关资源
    最近更新 更多