【问题标题】:Principle of NLP algorithmNLP算法原理
【发布时间】:2012-01-08 20:00:02
【问题描述】:

我是这个非常有用的问答网站的新手,我的英语不太好,很抱歉。

我对一个我认为不难做的网络项目很感兴趣,它是一种简化的冲浪。

Algorithm description 1
Algorithm description 2

这个算法确保孩子非常简单,因为它可以快速分析网页内容并找到相关信息。

谁能告诉我这个算法是如何运作的,我试图做出类似的东西?

这个算法的功能是什么?

谢谢!

【问题讨论】:

标签: algorithm nlp web genetic-algorithm


【解决方案1】:

我刚刚回答了非常相似的question。在您的特定情况下,手动创建主题列表,使用机器学习对一些示例进行训练,然后在搜索过程中,对每个搜索结果进行分类是有意义的强> 到主题之一。因此,您将获得按主题分组的搜索结果。

UPD。好的,这是一种可能方法的分步说明。

首先,看看我最近关于文档相似度计算的post。然后执行以下操作:

  1. 实现计算 2 个文本之间相似度的过程(如我的帖子中所述)或找到类似的内容。
  2. 创建多个文档集合,一个用于您要使用的每个类别(主题)(食品、IT、政治、医学等)。
  3. 计算每个集合中所有文档的公共向量。
  4. 当用户执行搜索时,计算您找到的每个结果的向量。
  5. 将每个结果分类到具有最相似公共向量的类别。
  6. 按计算类别对结果进行分组。

【讨论】:

  • 好的,谢谢,这很有用,但您能告诉我更多相关信息吗?
  • maui-indexer 可以帮助我吗?
  • @MikiCloud:不,similar_text 计算字符串(字符序列)之间的差异,而不是文本(单词序列)之间的差异。在您的计划中,您是否试图击败 Google 的结果?此外,20 个最常见的常用词不一定是主题词。
  • 不一定,但是当我删除诸如“a,the,and ...”之类的典型词时,我会得到描述主题的词。你认为呢?我怎样才能得到一个可以描述一个主题的词?你有什么建议?
【解决方案2】:

对我来说,NLP 是一个查看原始文本并对其进行标记的程序。

我这样看是因为我想把它作为一个训练者(自我监督),为一个咕哝成词的 GA 提供服务,只要你在马尔可夫链中记录用户对它说的话,这样你就可以使用尽可能多的处理器能力来加速突变。

请注意,我还没有这样做,但我认为这个想法很酷,它的黑客性很强,而且似乎可行。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-07-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-06-14
    • 2020-07-25
    • 2016-11-01
    • 2019-05-14
    相关资源
    最近更新 更多