【发布时间】:2020-08-02 05:20:12
【问题描述】:
我正在构建一个 Python 网络爬虫,它通过 eBay 搜索结果页面(在本例中为“游戏笔记本电脑”)并获取每件待售商品的标题。我正在使用 BeautifulSoup 首先获取存储每个标题的 h1 标签,然后将其打印为文本:
for item_name in soup.findAll('h1', {'class': 'it-ttl'}):
print(item_name.text)
然而,在每个带有'it-ttl'类的h1标签中,还有一个包含一些文本的span标签:
<h1 class="it-ttl" itemprop="name" id="itemTitle">
<span class="g-hdn">Details about </span>
Acer - Nitro 5 15.6" Gaming Laptop - Intel Core i5 - 8GB Memory - NVIDIA GeFo…
</h1>
我当前的程序打印出 span 标签 和 的内容标题: My console output
有人可以向我解释如何在忽略包含“详细信息”文本的跨度标签的情况下获取仅项目标题吗?谢谢!
【问题讨论】:
标签: python web-scraping beautifulsoup web-crawler html-parsing