【发布时间】:2020-04-22 18:21:55
【问题描述】:
我正在处理包含地点和日期的书面文本(文章和书籍的段落)。我想从包含相互关联的位置和日期的文本对中提取。例如,给定以下短语:
该男子于 1 月离开阿姆斯特丹,于 10 月 21 日抵达尼泊尔
我会有这样的输出:
>>>[(Amsterdam, January), (Nepal, October 21st)]
我尝试通过“连接词”(例如“and”)拆分文本,并按以下方式处理部分内容:查找指示位置的词(“at”、“in”、“from”、“to ”等)和表示日期或时间的词(“on”、“during”等),并加入您找到的内容。然而,这被证明是有问题的,因为指示位置和日期的单词太多,有时基本的“查找”方法无法区分它们。
假设我能够识别日期,并且给定一个以大写字母开头的单词,我能够确定它是否是一个位置。主要问题是它们之间的连接,并确保它们是连接的。
我认为像 ntlk 和 scapy 这样的工具会在这方面为我提供帮助,但是没有足够的文档来帮助我找到此类问题的确切解决方案。
任何帮助将不胜感激!
【问题讨论】:
-
Scapy 在这里不相关,因为它用于在真实网络上制作数据包,而不是 神经网络。
-
@RossJacobs 感谢您的意见!从标签中删除它。
标签: python nlp nltk linguistics