【发布时间】:2018-06-30 06:27:27
【问题描述】:
我正在使用 Scrapy 从大学网站上抓取大学论文主题。我知道如何使用正则表达式匹配关键字,但我真正想要的信息是与匹配项相同的 div 中的其他元素。 Scrapy 中的 Response.css(...).re(...) 函数返回一个字符串。有什么方法可以导航到正则表达式匹配的父 div?
例如:https://admissions.utexas.edu/apply/freshman-admission#fndtn-freshman-admission-essay-topics。在上面的页面上,我可以使用 response.css("*::text").re("Essay Topics") 匹配论文主题 h1。但是,我想不出一种方法来获取主题 A 和主题 N 下同一 div 中的 2 个实际论文主题。
【问题讨论】: