【问题标题】:A href catching一个 href 捕捉
【发布时间】:2010-07-17 17:53:45
【问题描述】:

我正在使用 BeautifulSoup 来解析一些 html。内容如下:

<tr> 
<th>Your provider:</th> 
<td> 

<img src="/isp_logos/la-la-la.ico" alt=""/> 
 <a href="/isp/SomeProvider"> 
 Provider name </a> 
 &nbsp;
 <a href="http://*/isp-comparer/?isp=000000"> 
 </a> 
</td> 
</tr>

我必须从链接中获取 SomeProvider 文本。我的代码是:

contentSoup = BeautifulSoup(ThatHtml)
print contentSoup.findAll('a', href=re.compile('/isp/(.*)'))

结果是空数组,为什么?也许还有其他方法?

【问题讨论】:

    标签: python html regex beautifulsoup


    【解决方案1】:

    通过您发布的代码和输入,我得到:

    [<a href="/isp/SomeProvider">   Provider name </a>]
    

    作为数组的返回。您使用的是 BeautifulSoup 最新的 3.1.x 版本吗?我实际上也遇到了同样的问题,但我下载了 BeautifulSoup 的 2.x 版本,认为 2.x 意味着它与 python 2.x 兼容。

    假设第一个包含 SomeProvider,您可以使用:

    contentSoup.a
    

    提取该标签。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-07-15
      • 1970-01-01
      • 2011-06-20
      • 1970-01-01
      • 1970-01-01
      • 2016-02-01
      • 2021-07-10
      相关资源
      最近更新 更多