【问题标题】:Use nlp to answer a customized question in a large corpus使用 nlp 回答大型语料库中的定制问题
【发布时间】:2020-07-22 23:27:36
【问题描述】:

假设我在一家公司的年度报告中有一个语料库,其中显示了 4 个行业的收入数据:汽车、半导体、绿色能源和医疗保健。对于人类来说,找到一个特定行业的收入数据并不难。如果我要使用 NLP 将其自动化,这样我就不必阅读它了,NLP 是否有可能将正确的收入数据与某个特定行业相匹配?

我将 NLP 用于情感分析、主题建模和文本生成。但这些似乎都与上述应用程序无关。有任何想法吗?我可以使用什么库中的什么函数?

【问题讨论】:

  • 我做过类似的事情,我认为这是可能的,你可以使用 AI 来分类和识别他们谈论某个行业的特定句子,然后使用 NLP 查找句子中的数字.分类部分需要很多与行业相关的句子样本,如果没有样本就得用关键词来选择。
  • 我只能想到用nltk中的concordance来提取提到一个行业的地方,但是不知道怎么匹配数字
  • 尝试寻找spacy实体检测。

标签: nlp


【解决方案1】:

如果提问者针对汽车、半导体、绿色能源和医疗保健这 4 个类别中的每一个类别发布一些示例文本,则相对容易发表评论。尽管如此,作者试图提供一种理论上可行的方法。


让我们尝试从 NLP 的角度来理解这个问题,如下所示。

  1. 有些文档是由一些内容组成的。每份文件都可以是财务报表或带有文本和相应事实的东西。
  2. 每个文档都应包含与一个类别相关的内容,即汽车、半导体等,
  3. 一个类的内容与另一个类的内容重叠的概率非零。例如,围绕绿色能源的内容可能会提到一些低排放汽车。

识别相似内容的方法如下。这些步骤取自作者here 的另一个答案。

  1. 步骤 1 部署 余弦相似度 算法来测量来自多个文档的内容之间的相似度。为了使其更接近语义相似度,使用 WORDNET 构建计算 余弦相似度 的特征。这将确保诸如“路径”之类的标记被视为更接近标记“道路”。

  2. 第 2 步 将超过阈值余弦值(例如:0.75)的不同文档中的内容分组为来自同一类的文档。

  3. 第 3 步 手动检查不同的组,以查看同一类的内容是否归为一组。如果这些组中混合了多个类,则通过特征工程细化余弦相似度。例如,添加 TfIDf 以删除信息量较少的特征。

  4. 第 4 步根据第 3 步的结果,部署更多特征工程,直到组同质化。

  5. 第 5 步 一旦分组看起来是同质的,就可以部署信息检索技术来检索信息。这一步可以说是上面列出的所有步骤中最困难的一步,并且作者在撰写此内容时还没有任何 IE/IR 技术的工作知识。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-03-07
    • 1970-01-01
    • 2018-12-31
    • 1970-01-01
    • 2015-11-21
    • 1970-01-01
    • 2019-08-24
    • 1970-01-01
    相关资源
    最近更新 更多