【发布时间】:2014-09-14 21:42:44
【问题描述】:
我只是按照教程来学习如何使用 rapidminer,但我不知道我做错了什么。我试过的一个教程是这样的:http://auburnbigdata.blogspot.com/2013/04/web-crawling-with-rapidminer.html
我设置了抓取 Web 进程并将其连接到结果端口。我的参数如下:
网址:http://auburnbigdata.blogspot.com
爬取规则:store_with_matching_url .+auburnblogspot.+
follow_link_with_matching_url .+auburnblogspot.+
将页面写入文件:选中
添加页面作为属性:选中
输出目录:C:\Users\Owen Capobianco\Desktop\Crawldata
扩展名:txt
最大页数:(空白)
最大深度:2
域名:网络
延迟:500
最大线程数:1
用户代理:Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/36.0.1985.125 Safari/537.36
遵守机器人排除:检查
我的 Crawldata 文件夹仍然是空的并且没有结果。我确定我在做一些愚蠢的错误,因为这基本上是我第一次使用该软件。
谢谢。
【问题讨论】: