【问题标题】:What is Zone Hashing in Natural Language Processing?自然语言处理中的区域散列是什么?
【发布时间】:2013-08-30 16:53:14
【问题描述】:

NLP 领域的任何人都听说过区域散列这个术语吗?据我所知,区域哈希是遍历文档并提取句子的过程。然后对累积的句子进行哈希处理,然后继续处理接下来的 n 个句子...

我在 Google 上没有找到任何对此的引用,所以我想知道它是否有不同的名称。它应该与测量文本相似度/接近度有关。

也许它指的是局部敏感散列?

【问题讨论】:

  • 它似乎与信息检索比实际的 NLP 更相关

标签: nlp information-retrieval


【解决方案1】:

据我所知,“区域哈希”在 NLP 作为一门学科中并不是一个成熟的概念。它只是一些算法(与 NLP 相关)中使用的一个简单概念。我知道的唯一一个使用它的是Sphinx 搜索服务器,在这里,“区域哈希”只是“称为区域的对象的哈希”,其中“区域”描述如下:

区域可以正式定义如下。之间的一切 开始和匹配的结束标记称为跨度,聚合 对应共享相同标签名称的所有跨度称为区域。 例如,在

和 出现之间的所有内容 文档字段属于H1区域。

由 index_zones 指令启用的区域索引是可选的 HTML剥离器的扩展。所以它也将要求 启用剥离器(使用 html_strip = 1)。的价值 index_zones 应该是这些标签名称的逗号分隔列表,并且 应作为区域索引的通配符(以星号结尾)。

区域可以任意嵌套和重叠。唯一的要求是 每个开始标签都有一个匹配的标签。你也可以任意 两个区域的数量(如唯一的区域名称,例如 H1)和跨度 (所有这些 H1 标记的出现)在文档中。一旦被索引, 然后可以将区域用于与 ZONE 运算符匹配,请参阅 第 5.3 节,“扩展查询语法”。

这些结构的散列在传统意义上用于加速搜索和查找。我不知道任何“更深层次”的含义。

也许它指的是局部敏感散列?

局部敏感散列是一种用于多维数据的概率方法,我看不到与区域散列的任何更深层次的联系,然后事实是两者都使用散列函数。

【讨论】:

  • 谢谢你,lejlot。我的最终目标是看看如何在 NLP 中使用它来测量文本之间的相似性,并找到其他可以使用的技术。您是否碰巧知道任何其他技术?
  • 这样的方法有数百种,搜索论文“字符串相似度度量”、“概念相似度度量”或“文档相似度度量”。它们的范围从单一指标(如 Hamming/Jaccard)到文本内核(也值得搜索)——基于文本(字符串内核)和/或含义(wordnet 内核)
猜你喜欢
  • 2011-06-13
  • 1970-01-01
  • 2020-07-25
  • 2010-12-08
  • 2013-12-18
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-07-23
相关资源
最近更新 更多