【问题标题】:Rapidminer 6.0.008 not saving web crawl resultsRapidminer 6.0.008 不保存网络爬取结果
【发布时间】:2014-09-14 21:42:44
【问题描述】:

我只是按照教程来学习如何使用 rapidminer,但我不知道我做错了什么。我试过的一个教程是这样的:http://auburnbigdata.blogspot.com/2013/04/web-crawling-with-rapidminer.html

我设置了抓取 Web 进程并将其连接到结果端口。我的参数如下:

网址:http://auburnbigdata.blogspot.com

爬取规则:store_with_matching_url .+auburnblogspot.+

follow_link_with_matching_url .+auburnblogspot.+

将页面写入文件:选中

添加页面作为属性:选中

输出目录:C:\Users\Owen Capobianco\Desktop\Crawldata

扩展名:txt

最大页数:(空白)

最大深度:2

域名:网络

延迟:500

最大线程数:1

用户代理:Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/36.0.1985.125 Safari/537.36

遵守机器人排除:检查

我的 Crawldata 文件夹仍然是空的并且没有结果。我确定我在做一些愚蠢的错误,因为这基本上是我第一次使用该软件。

谢谢。

【问题讨论】:

    标签: web-crawler rapidminer


    【解决方案1】:

    似乎没有任何形式为 www.auburnblogspot.com 的网站。尝试将正则表达式更改为.+auburnbigdata.+ 之类的内容。

    【讨论】:

    • 谢谢!这就是问题所在。那篇博客的作者在更改博客名称时似乎没有更新他的教程......
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-10-12
    • 2019-10-17
    • 2022-01-21
    相关资源
    最近更新 更多