【发布时间】:2020-12-17 18:35:27
【问题描述】:
所以我想刮掉这个网页中所有的粗体部分标题,例如。简称,解释,行政管理……但到目前为止,我只能对第一部分的前 2 个这样做。
import scrapy
class ActScraper1Spider(scrapy.Spider):
name = 'act_scraper_1'
allowed_domains = ['sso.agc.gov.sg']
start_urls = ['https://sso.agc.gov.sg/Act/AA2004']
def parse(self, response):
info = response.xpath("//div[@class='body']/table//td[@class='part']/div[@class='prov1']")
for titles in info:
yield {
'Section title': titles.xpath(".//td[@class='prov1Hdr']/span[2]/text()").get()
}
从 8 //table[@width='100%'] 可以看出,这个网页一共包含了 8 个部分
标题位于此处 //div[@class='body']/table//td[@class='part']/div[@class='prov1']/td[@class='prov1Hdr ']/跨度/文本()
【问题讨论】:
标签: python-3.x scrapy