【发布时间】:2018-09-21 04:25:44
【问题描述】:
我正在尝试抓取网页以收集图像名称及其各自的资产 URL,并将它们写入 CSV 中的两个单独列。我无法将 attrs 从标签中分离出来。
在 BS4 中,我可以运行:
soup.find_all('a')
成功返回下面的html(乘以页面上的照片数)
<a aria-label="SomeImageName" data-asset-id="10101010101"
href="SomeWebsite">
<img alt="SomeImageName"
src="https://SomeImageUrl"/>
</a>
我已尝试运行以下(以及许多其他变体)
soup.find_all('a', attrs{"aria-label", "src"})
他们回来了
[]
有人知道如何从标签中提取这些数据并写入 CSV 吗?
干杯!
【问题讨论】:
标签: python web-scraping beautifulsoup