【发布时间】:2017-10-11 09:45:22
【问题描述】:
我正在尝试使用 StanfordNLP 解析书本长度的文本块。 http 请求运行良好,但在 StanfordCoreNLPServer.java 中文本长度 MAX_CHAR_LENGTH 存在不可配置的 100KB 限制。
目前,我在将文本发送到服务器之前将其切碎,但即使我尝试在句子和段落之间进行拆分,这些块之间也会丢失一些有用的共指信息。据推测,我可以解析具有大量重叠的块并将它们链接在一起,但这似乎 (1) 不优雅和 (2) 需要相当多的维护。
是否有更好的方法来配置服务器或请求以删除手动分块或跨块保留信息?
顺便说一句,我正在使用 python requests 模块发布,但我怀疑这会有所不同,除非 corenlp python 包装器以某种方式处理这个问题。
【问题讨论】:
标签: stanford-nlp