【发布时间】:2021-11-09 01:41:51
【问题描述】:
我有一个装满 .html 文件的文件夹。有没有办法使用 scrapy 抓取数据?
我的尝试:
import scrapy
import os
LOCAL_FOLDER = 'html_files/'
BASE_DIR = os.path.dirname(os.path.dirname(os.path.abspath(__file__)))
class MySpider(scrapy.Spider):
name = 'mySpider'
start_urls = [f"file://{BASE_DIR}/{LOCAL_FOLDER}"]
def parse(self, response):
rows = response.xpath('//div[@class="data"]//tbody/tr')
print(rows)
结构:
html_files/
├── b.html
├── c.html
├── d.html
├── e.html
├── f.html
任何指导将不胜感激。
【问题讨论】:
-
您对术语目录和文件夹的使用不一致。 “文件夹”是一个 Windows 概念,与此处的适当术语目录不同。
标签: python html web-scraping scrapy