【发布时间】:2017-06-14 20:37:24
【问题描述】:
我正在爬一个教授的webpage。
在她的研究描述下,有两个超链接,分别是“TEDx UCL”和“这里”。
我使用像 '//div[@class="group"]//p/text()' 这样的 xpath
获得前 3 段。
和'//div[@class="group"]/text()' 以获取带有一些换行符的最后一段。但是这些很容易清洗。
问题是最后一段只包含文本。超链接丢失。虽然我可以单独提取它们,但是将它们放回对应的位置很繁琐。
如何获取所有文本并保留超链接?
【问题讨论】:
标签: python scrapy web-crawler