【问题标题】:is there a specific way to write xpaths into rapidminer for web crawling有没有一种特定的方法可以将 xpaths 写入 rapidminer 以进行网络爬取
【发布时间】:2019-12-17 15:01:36
【问题描述】:

我已经尝试了很多选择,在很多天里都在尝试提取数据。我不知道我哪里错了。 例如,我在网站 reviewcentre.com 上查看汽车销售网站的评论。 我正在努力检索信息,我的大多数 xpath 似乎都不正确。 我在哪里可以最好地学习如何正确地做到这一点,我花了好几天的时间。

https://www.reviewcentre.com/car_dealers/we_buy_any_car_-_wwwwebuyanycarcom-review_14068020

我知道如何复制 xpaths,但是当涉及到 rapidminer 时,我无法提取数据。 我知道我做错了,但不幸的是我不知道什么是对的。

例子包括

//*[@id="ReviewTitle-14068020"]
h:html/h:head/h:title/text() 
this one works!
//*[@id="ReviewBox-14068020"]/div[1]/div[2]/p[2]/span

我从网站上检索 xpath 似乎没有问题,但使用它在 rapidminer 上提取数据根本不起作用。如果有人能指出正确的方向,我将不胜感激。

【问题讨论】:

    标签: xpath web-scraping web-crawler rapidminer


    【解决方案1】:

    显然,您不想在 xpath 中使用唯一 ID

    确保您也了解 xml 命名空间的概念。

    【讨论】:

      猜你喜欢
      • 2020-06-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-11-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多