【发布时间】:2017-04-25 02:46:10
【问题描述】:
我有一个原始文本文件形式的报纸语料库,我希望能够从中提取社论。大多数社论都在“EDITORIAL”一词的第三个实例之后开始,并以页脚“sfbg”结束。
我的想法是使用python的正则表达式来提取这些社论。我正在使用 CategorizedPlaintextCorpusReader。
我自己尝试查找 CategorizedPlaintextCorpusReader 的方法列表,但结果是空的。
【问题讨论】:
-
(.*?EDITORIAL){3}(.*?)sfbg -
您能详细说明一下吗?总的来说,我对编程还是很陌生,我的语法还没有完全确定。