【发布时间】:2013-09-16 18:53:15
【问题描述】:
例如,这是我的字符串:
myString = "<html><body><p>Hello World!</p><p>Hello Dennis!</p></body></html>"
我想要实现的是:
myList = ['Hello World!','Hello Dennis!']
使用正则表达式或其他方法,如何过滤掉myString中的段落文本而忽略html标签以实现myList?
我试过了:
import re
a="<body><p>Hello world!</p><p>Hello Denniss!</p></body>"
result=re.search('<p>(.*)</p>', a)
print result.group(1)
结果是:Hello world!</p><p>Hello Denniss!,当我尝试(.*)(.*) 时,我得到了Hello World!
这个字符串只是一个例子。该字符串也可能是 <garbage>abcdefghijk<gar<bage>,具体取决于 Web 开发人员对网站的编码方式。
这可能是一个复杂的正则表达式,但我需要学习这一点,因为这是我将在今年晚些时候参加的网络安全竞赛,我认为我最好的选择是开发一种在 @ 之间搜索文本的算法987654332@ 和 <。
我该怎么办?
对不起,如果我的问题格式不正确,我有一点学习问题。
【问题讨论】:
-
@TyrantWave FWIW
-
@HamZa - 嗯,我不太同意那个元数据,特别是当问题是关于提取文本时(哪个正则表达式确实失败了)。我当然永远不会将其链接为答案,至少在没有给出完整解释的情况下。评论就是这样 - 对问题的评论。