【发布时间】:2015-01-06 21:18:10
【问题描述】:
我很难让 CoreNLP 系统在诗歌语料库中正确找到一个句子的结尾和另一个句子的开头。
苦苦挣扎的原因:
- 有些诗在整个长度上都没有标点符号(有时甚至没有大小写)
- 有些诗的句子从一段到另一段
- 有些诗在每行开头都有大写
This is a particularly tricky one (系统认为第一句以第二节开头的“.”结尾)
鉴于缺少大写和标点符号,我想我会尝试使用 -tokenizeNLs 看看是否可以改善它,但它太过分了,并切断了任何介于两者之间的句子空行(有几个)
这些句子通常在行尾结束,但并非总是如此,所以如果系统可以将行尾视为潜在的断句候选者,并且可能权衡这些句子的可能性端点,但我不知道如何实现。
有没有一种优雅的方法来做到这一点?还是另一种选择?
提前致谢!
(预期句子输出here)
【问题讨论】:
-
您能否提供您在问题中所期望的输出? (那首诗的句子数组。)
-
最后我们需要解析树的字符串(该项目是一个句法分析,查看嵌入子句等常见模式,以及出现换行符的位置)。但是,如果您只需要句子列表,那么您现在可以在我的问题底部找到它。
-
这可能有用/有趣:ptk.jonathanchin.com
标签: java nlp stanford-nlp