【发布时间】:2019-08-14 19:30:11
【问题描述】:
我试图在这个网站上抓取帖子的内容标题:https://www.hortidaily.com/sector/553/greenhouse/
使用 Google 表格 Importxml 功能。
所有帖子都以相同的格式编写:
<a class="article" href="link1">
<img src="img1.jpg" align="default" border="0" class="indexdefault">
<h1>Titre1</h1>
<p>Texte1</p>
</a>
带 Xpath = 的 ImportXML 函数:
- //a[@class='article']/@href return link1 : ok
- //a[@class='article'][1]/img/@src return img1 : ok
- //a[@class='article'][1]/h1 return #NA (imported content is empty) 即使 XPath 在 chrome XPath Helper 中工作...
虽然 //h1[1] 返回了第一篇文章的标题,但问题我不明白为什么 //a[@class='article'][1]/h1 不起作用,我想成为确定我得到的h1是第一个<a class="article" href="link1"> 下的h1
我已经尝试了几乎所有我能想象到的,没有发现问题。我需要一些帮助!
提前谢谢你
【问题讨论】: