【发布时间】:2020-12-17 13:39:28
【问题描述】:
我正在刮https://www.patelco.org/search-results#stq=&stp=1,我想刮所有的页面,我对scrapy有一个基本的了解,这是我正在使用的代码:
import scrapy
import json
class PatelcospiderSpider(scrapy.Spider):
name = 'patelcospider'
start_urls = ['https://www.patelco.org/search-results''#stq=&stp=1']
def parse(self, response):
columns = {
"question": [],
"answer": []
}
QUESTION_ANSWER_SELECTOR = ".st-ui-result"
QUESTION_SELECTOR = ".st-ui-type-heading ::text"
ANSWER_SELECTOR = ".st-ui-type-detail ::text"
questions_answers = response.css(QUESTION_ANSWER_SELECTOR)
for question_answer in questions_answers:
question = question_answer.css(QUESTION_SELECTOR).getall()
question = " ".join(question).strip()
answer = question_answer.css(ANSWER_SELECTOR).getall()
answer = " ".join(answer).strip()
columns["question"].append(question)
columns["answer"].append(answer)
columns["link"].append(response.url)
return columns
在执行时它没有返回任何值。这是相关的输出:
2020-08-28 20:39:48 [scrapy.core.engine] 信息:蜘蛛打开
2020-08-28 20:39:48 [scrapy.extensions.logstats] 信息:已爬取 0 页 (以 0 页/分钟),抓取 0 项(以 0 项/分钟)
2020-08-28 20:39:48 [scrapy.extensions.telnet] 信息:Telnet 控制台 在 127.0.0.1:6023 上收听
2020-08-28 20:39:55 [scrapy.core.engine] 调试:已爬网 (200)
https://www.patelco.org/search-results#stq=&stp=1>(推荐人:无) 2020-08-28 20:39:56 [scrapy.core.scraper] 调试:从 https://www.patelco.org/search-results>
{'问题':[],'答案':[]}
2020-08-28 20:39:56 [scrapy.core.engine] 信息:关闭蜘蛛 (完)
我认为问题在于 Scrapy 正在抓取 https://www.patelco.org/search-results,它实际上没有任何东西可以返回。我做了很多搜索,但我不知道如何解决它。
提前致谢。
【问题讨论】:
标签: python web-scraping scrapy