【发布时间】:2020-05-04 20:32:39
【问题描述】:
通常,人们会使用 XPath 查询来获取某个值或节点。就我而言,我正在使用谷歌电子表格进行一些网络抓取,使用importXML 函数自动更新一些值。下面举两个例子:
=importxml("http://www.creditagricoledtvm.com.br/";"(//td[@class='xl7825385'])[9]")
=importxml("http://www.bloomberg.com/quote/ELIPCAM:BZ";"(//span)[32]")
问题是我正在抓取的页面会时不时地发生变化,而且我对 XML/XPath 了解甚少,因此需要大量的试验和错误才能到达一个节点。我想知道是否有任何工具可以用来指向可以提供适当查询的元素(无论是在页面中还是在其代码中)。
例如,在第二种情况下,我注意到我想要的信息在 span 节点中(因此是 (//span)),所以我将它们全部打印在电子表格中并使用行数找到 @987654324 @ 指数。这需要很长时间才能加载,因此非常不方便。另外,我什至不记得我是如何计算出//td[@class='xl7825385'] 查询的。因此,为什么我想知道是否有更实用的指向页面元素的方法。
【问题讨论】:
标签: xpath web-scraping google-sheets