【发布时间】:2017-06-14 12:33:04
【问题描述】:
我有一个手动输入文件,其中包含引文,每个文件的格式为:
和以前的机器不同 基于学习的NER,因为它使用来自整体的信息 文档对每个单词进行分类,只有一个分类器。以前涉及从整个文档中收集信息的工作通常使用二级分类器, 它纠正了基于句子的主要分类器的错误。
这是我目前使用 python 的 re 模块的方法:
citance = citance[citance.find(">")+1:citance.rfind("<")]
fd.write(citance+"\n")
我试图提取从第一个右尖括号 (">") 到最后一个左尖括号 ("
它与以前基于机器学习的 NER 不同之处在于它使用 来自整个文档的信息来对每个单词进行分类,只需 一个分类器。
以前的工作涉及到 从整个文档中收集信息通常使用 二级分类器,纠正初级分类器的错误 基于句子的分类器。
我想要的输出:
它与以前基于机器学习的 NER 不同之处在于它使用 来自整个文档的信息来对每个单词进行分类,只需 一个分类器。以前的工作涉及 从整个文档中收集信息通常使用 二级分类器,纠正初级分类器的错误 基于句子的分类器。
我怎样才能正确地实现它?
【问题讨论】:
标签: python regex python-3.x citations