【发布时间】:2019-12-17 15:01:36
【问题描述】:
我已经尝试了很多选择,在很多天里都在尝试提取数据。我不知道我哪里错了。 例如,我在网站 reviewcentre.com 上查看汽车销售网站的评论。 我正在努力检索信息,我的大多数 xpath 似乎都不正确。 我在哪里可以最好地学习如何正确地做到这一点,我花了好几天的时间。
https://www.reviewcentre.com/car_dealers/we_buy_any_car_-_wwwwebuyanycarcom-review_14068020
我知道如何复制 xpaths,但是当涉及到 rapidminer 时,我无法提取数据。 我知道我做错了,但不幸的是我不知道什么是对的。
例子包括
//*[@id="ReviewTitle-14068020"]
h:html/h:head/h:title/text()
this one works!
//*[@id="ReviewBox-14068020"]/div[1]/div[2]/p[2]/span
我从网站上检索 xpath 似乎没有问题,但使用它在 rapidminer 上提取数据根本不起作用。如果有人能指出正确的方向,我将不胜感激。
【问题讨论】:
标签: xpath web-scraping web-crawler rapidminer