【发布时间】:2012-12-12 06:53:03
【问题描述】:
抱歉有点笨,但我真的需要 Python 方面的帮助。
['<a href="needs to be cut out">Foo to BAR</a>', '<a href="this also needs to be cut out">BAR to Foo</a>']
所以我有这个元组,我需要删除该 href 属性内的内容以及 <a> 标记内的内容 - 基本上,我想要一个看起来像这样的元组:
[["needs to be cut out", "Foo to BAR"], ["this also needs to be cut out", "BAR to Foo"]]
在href属性里面有很多特殊符号,比如
<a href="?a=p.stops&direction_id=23600&interval=1&t=wml&l=en">
我认为,如果我真的不需要尝试解析对象树而只需要网页中的几个 url 和单词,那么使用 HTML 解析器会很麻烦。但我真的不明白如何形成正则表达式。我形成的正则表达式似乎完全错误。所以我在问是否有人可以帮助我。
【问题讨论】:
标签: html regex string parsing python-2.7