【问题标题】:How stanford-nlp distinguishes between abbreviation dot and full stop?stanford-nlp 如何区分缩写点和句号?
【发布时间】:2016-06-01 14:09:10
【问题描述】:

在这个链接http://nlp.stanford.edu/software/tokenizer.html 处理文档并且所有缩写点和句号的识别方式不同。我想知道这背后使用的逻辑或过程。请解释。

【问题讨论】:

标签: machine-learning nlp stanford-nlp


【解决方案1】:

您可以将文档拆分为句子(使用 Stanford 或任何其他工具,例如 this);显然,句末的点是句号。

【讨论】:

  • 机器不清楚句子末尾的点。因此OP的问题。
  • 例如:Hello world. My name is Mr. Smith. I work for the U.S. Government and I live in the U.S. I live in New York.。区分缩写点和句号绝不是一项简单的任务。这就是为什么不同的分割工具有不同的准确度,会产生不同的结果。
  • 另外你会遇到像我上面给出的例子一样,缩写结束一个句子,在这种情况下"When an abbreviation with a period ends a sentence, that period will suffice to end the sentence."
  • 这就是分句系统的重点;它们旨在区分“美国”中的点和句号...
  • 你测试过它们吗?我认为它们几乎没有您想象的那么可靠,尤其是在涉及边缘情况时。我测试了很多包括斯坦福,你可以看到结果here
猜你喜欢
  • 1970-01-01
  • 2012-09-03
  • 1970-01-01
  • 2012-08-12
  • 1970-01-01
  • 2022-10-05
  • 1970-01-01
  • 2017-10-28
  • 1970-01-01
相关资源
最近更新 更多