【发布时间】:2019-03-12 10:28:44
【问题描述】:
我有一个从 html 下载的 txt 文件,其内容如下所示。
<TYPE>GRAPHIC
<TEXT>
.....
Example of omitted part: M%$2G]\U?HQM7L^!5K*'5E/1@0?IQ5\S^0/\ G$O\IORU\W:1YV\MKK(UK1# (I guess are some kind of non-Ascii characters)
.....
</TEXT>
我想删除<TYPE>GRAPHIC 和</TEXT> 之间的所有内容并尝试re.sub('<TYPE>GRAPHIC(.*)</TEXT>', '', reader) 但不起作用。
【问题讨论】:
-
您可能需要添加单行模式和惰性量词,如下所示:
re.sub('<TYPE>GRAPHIC(.*?)</TEXT>', '', reader, flags = re.S)