【发布时间】:2016-11-18 01:06:22
【问题描述】:
我正在为一家非营利组织开展一个项目,以帮助处理和分类每年来自世界各地的现场工作人员/承包商的 1000 份报告。我对 NLP 比较陌生,因此想寻求小组对解决我们问题的方法的指导。
我将重点介绍当前的流程以及我们面临的挑战,并希望您能帮助我们以最佳方式解决我们的问题。
当前流程:现场官员以最佳实践的形式提交本地运行项目的报告。这些报告随后由全职策展人团队处理,他们 (i) 确保他们遵守最佳实践模板并 (ii) 编辑文档以改进语言/风格/语法。
挑战:随着现场工作人员数量的增加,生成的报告量也在增加,我们的编辑现在正成为瓶颈。
解决方案:我们希望自动化流程的第一步,即检查文档是否符合组织最佳实践模板
基本上,我们需要确保每个报告都包含 3 个组件,即: 1. 说明其目的:此最佳实践解决了哪些主题/问题? 2. 识别受众:这是给谁的? 3. 亮点相关性:读者看完后能做什么?
这是一个良好报告提交的示例。
“本文档介绍了在发展中国家成功应用最佳做法的技术。本研究旨在帮助低收入农民确定一套最佳做法,用于在价格不透明的地方为农产品定价。通过实施这些流程,农民将能够为他们的产品获得更好的价格并增加他们的家庭收入。”
到目前为止,我们的方法是使用 RegEx 并检查关键字。即,为了检查合规性,我们使用以下逻辑: 1 检查“说明目的”=我们做一个正则表达式来匹配“目的”、“意图” 2 检查“识别观众”=我们做一个正则表达式来匹配“识别”,“是为了” 3 检查“突出显示相关性”=我们使用正则表达式匹配 'able to'、'allows'、'enables'
目前的 RegEx 方法似乎非常原始且有限,所以我想询问社区是否有更好的方法来使用 NLTK、CoreNLP 之类的东西来解决这个问题。
提前致谢。
【问题讨论】:
标签: nlp nltk linguistics stanford-nlp