【发布时间】:2019-12-04 00:09:53
【问题描述】:
我正在尝试解析一个网站并从中获取所谓的 PSC 代码。该网站的 PSC 代码结构如下:
<span class="results_title_text">PSC (Code): </span>
</td>
<td width="30%">
<span class="results_text">
MED & SURGICAL INSTRUMENTS,EQ & SUP
(
<a alt="Click here to drill down by PSC Code 6515" href="?q=60854+PRODUCT_OR_SERVICE_CODE%3A%226515%22&s=FPDS.GOV&templateName=1.5.1&indexName=awardfull&x=0&y=0" title="Click here to drill down by PSC Code 6515">6515</a>
)
</span>
</td>
</tr>
<tr>
到目前为止,我已经编写了找到带有文本“PSC(代码):”的跨度的代码,但现在我不确定如何到达包含实际 PSC 代码的下一个跨度。这是我到目前为止所拥有的:
html_page = urllib.request.urlopen(url)
soup = BeautifulSoup(html_page, features='lxml')
#print(soup)
span = soup.findAll('span', {'class': 'results_title_text'})
for s in span:
if s.text == 'PSC (Code): ':
print(s)
这段代码只是在 html 中的任何地方打印“PSC(代码):”。关于如何进行的任何想法?
【问题讨论】:
-
跨度封闭链接是否总是
class="results_text"? -
是的,它总是这样列出的。
-
你有没有尝试过? SO 不是代码编写服务——如果你熟悉漂亮的汤,你就可以自己快速编写。请参考find_all
-
您好,我确实编写了一些代码,但功能极少。我会用我的代码重写问题
-
你想要的输出到底是什么?
标签: python html beautifulsoup tags