【问题标题】:python regular expression could not find all images filespython正则表达式找不到所有图像文件
【发布时间】:2013-08-30 19:15:45
【问题描述】:

我正在尝试使用 re.compile 获取网页中的所有图像文件

title=re.compile("<img src='(.*)jpg'")

但它无法捕捉到所有以“jpg”结尾的香味,它在一个包含许多图像的网络中只有 3 个非常长的字符串(许多链接以 jpg 结尾),有人可以帮我解决这个问题。 提前致谢

【问题讨论】:

    标签: python regex python-2.7


    【解决方案1】:

    你的表情太贪心了。统治它:

    re.compile("<img src='([^']*)jpg'")
    

    但是,更好的方法是使用适当的 HTML 解析器,例如 BeautifulSoup:

    for image in soup.find_all('img', src=True):
        print image['src']
    

    例如,查找所有带有src 属性的&lt;img /&gt; 标记。

    【讨论】:

    • +1 用于解决问题并提供更好的解决方法。 @hln,您应该查找进行惰性匹配的不同方法——Martijn 使用的事实是会有一个结尾引号,您还可以使用*? 使用稍微复杂的正则表达式。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-11-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多