【发布时间】:2017-07-18 11:08:18
【问题描述】:
我正在尝试使用 core-nlps 的 DocumentPreprocessor 方法将给定的文本拆分为句子。
下面是我正在使用的代码。
List<String> splitSentencesList = new ArrayList<>();
Reader reader = new StringReader(inputText);
DocumentPreprocessor dp = new DocumentPreprocessor(reader);
for(List<HasWord> sentence :dp){
splitSentencesList.add(Sentence.listToString(sentence).toLowerCase().replace(" .", ""));}
这适用于大多数情况。但是,我们如何处理句子中的连词呢?
例如:
I like coffee and donuts for my breakfast.
理想情况下,应进一步处理为:
I like coffee for my breakfast.
I like donuts for my breakfast.
一种选择是执行基于正则表达式的规则来进一步拆分它们。在 core-nlp 中是否有任何内置方法可以实现这一点。
对此的任何指针表示赞赏。
【问题讨论】:
标签: java regex stanford-nlp