【发布时间】:2011-12-01 12:14:03
【问题描述】:
我正在使用 anemone gem(Ruby- 1.8.7 和 Rails 3.1.1)开发爬虫。我应该如何从抓取/下载中跳过扩展名为 pdf、doc、zip 等的网页。
【问题讨论】:
标签: ruby ruby-on-rails-3 ruby-on-rails-3.1 web-crawler anemone
我正在使用 anemone gem(Ruby- 1.8.7 和 Rails 3.1.1)开发爬虫。我应该如何从抓取/下载中跳过扩展名为 pdf、doc、zip 等的网页。
【问题讨论】:
标签: ruby ruby-on-rails-3 ruby-on-rails-3.1 web-crawler anemone
ext = %w(flv swf png jpg gif asx zip rar tar 7z gz jar js css dtd xsd ico raw mp3 mp4 wav wmv ape aac ac3 wma aiff mpg mpeg avi mov ogg mkv mka asx asf mp2 m1v m3u f4v pdf doc xls ppt pps bin exe rss xml)
Anemone.crawl(url) do |anemone|
anemone.skip_links_like /\.#{ext.join('|')}$/
...
end
【讨论】:
http://example.org/how-to-generate-pdf.html这样的url会被跳过。点也应该被转义。 ext = %w(pdf doc etc ...) 和 anemone.skip_links_like /\.#{ext.join('|')}$/ 怎么样