【问题标题】:How do I use findall in html string?如何在 html 字符串中使用 findall?
【发布时间】:2020-09-08 02:09:20
【问题描述】:

我的代码:

mug_cup_link = '.....'
mc_source = urlopen(mug_cup_link).read()
name=findall('<a href="" >".*"</a>',mc_source)

我正在搜索多个名称,而不仅仅是一个。

【问题讨论】:

  • 提示:不要使用正则表达式来解析 HTML。改用一些解析器。见Parsing HTML Using Python
  • 但我的评估必须使用 regex 。我无法改变它。而且我不知道如何找到项目名称
  • 您应该使用捕获组。见here
  • 另外,regex101 可能对您有用。
  • 谢谢:D 真的很有用

标签: python html


【解决方案1】:

如果你想使用正则表达式你可以这样改变

import re
s = """<a href="https://zombieunlimited.com/rancid-santa-mug/" >Rancid Santa Mug</a> """
print(re.search('<a.*>(.*)<\/a>', s).start(1))

希望它对你有用!

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-05-15
    • 1970-01-01
    • 2013-10-01
    • 1970-01-01
    • 1970-01-01
    • 2012-10-18
    • 1970-01-01
    相关资源
    最近更新 更多