【发布时间】:2020-10-25 20:19:29
【问题描述】:
我正在尝试构建一些正则表达式以匹配 html 页面中的 div 类。看看这个例子:
<div class="ba bb bc bd be">
<div class="ba bb">
我需要的是一个正则表达式来获得第二类(ba bb),所以包括中间空格在内的五个字符。我试过了
[a-z]{4}
但它不起作用。我不知道该怎么做。
编辑 1:我使用网站 https://regexr.com/ 来测试我提供的文本。
使用正则表达式
[a-z]{2} [a-z]{2}
还有
[a-z]{2}\s[a-z]{2}
我得到
但我只需要一个匹配第二个,所以这个正则表达式匹配的比我需要的多。
使用正则表达式
'"([a-z]{2}) \1"'
它不匹配任何东西。我需要指定我不能使用双引号字符,因为我需要在 BeautifulSoup 中使用这个正则表达式,以便从源中删除字符类型。
【问题讨论】:
-
关于:[a-z ]{2} [a-z ]{2}
-
它不像我预期的那样工作
标签: python html regex beautifulsoup