【问题标题】:Can Rapidminer extract an XPath value from a Specific list of URLs?Rapidminer 可以从特定的 URL 列表中提取 XPath 值吗?
【发布时间】:2014-06-14 12:46:04
【问题描述】:

我一直在玩 Rapidminer,但似乎不太明白这一点。我在一个 excel 文件中列出了一个巨大的 URL 列表,并且想从每个 URL 中提取一个 XPath 元素。无论如何我可以用 Rapidminer 做到这一点吗?

我看过 Neil Mcguigan 的教程,但它们似乎是从总体上抓取网站/站点,而不是从一组特定的 URL。

【问题讨论】:

  • 看起来与here 的问题非常相似。

标签: xpath web-scraping web-crawler rapidminer


【解决方案1】:

您可能想查看Apache NutchScrapy 和类似的网络抓取工具。

您可能只是在为这项工作寻找错误的工具:您想抓取网站上的数据,而不是进行实际的“数据挖掘”(这更像是一种启发式统计分析)。

Nutch (Java) 和 Scrapy (Python) 是用于开发自定义网络爬虫和进行网络抓取的平台。

【讨论】:

    猜你喜欢
    • 2012-02-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-11-06
    • 1970-01-01
    • 1970-01-01
    • 2018-08-30
    • 1970-01-01
    相关资源
    最近更新 更多