【发布时间】:2011-08-02 01:13:43
【问题描述】:
我是编程新手,我有一个问题,关于如何从网站上的页面中提取特定信息,处理数据以检查它是否符合某些参数,以及存储符合参数的页面的 url。
问题是这样的:
-有一个网站有几篇文章。 -我希望能够列出网站上包含少于 x 个单词的文章的 url。
我不需要编码或任何其他方面的帮助,因为我是新手,这本质上是我学习编程的自我练习。
我只是对如何解决这个问题有疑问。我知道 HTML 和最小的 Ruby,这就是我的知识范围。
我只是不知道如何从网页中“提取”数据。 :S 我会用什么来拉取 HTML?拉取 HTML 后如何处理它?将其转换为 Ruby?如果有,怎么做?
【问题讨论】:
-
将问题标记为 ruby。你说的是一个 HTML 解析器。我不知道 ruby,但很快就会有人来回答。
-
对于这个项目来说,Ruby 和 HTML 知识是否足够我必须进行网页抓取?
-
哦,绝对是,这就是您所需要的。有很多库可以做到这一点
-
+1 向您询问什么是正确的方法,而不是假设正则表达式是正确的。正则表达式很少与 HTML 或 XML 很好地混合,但一个好的解析器总是正确的方法,无论是 Ruby、Python、Perl 还是 Java。而且,是的,Ruby 和 Nokogiri 是一个很棒的网络抓取解决方案。当您需要浏览网站时请查看
Mechanize,当您需要将标签列入白名单/黑名单和清理页面时,请查看sanitize或loofah。
标签: html ruby html-parsing web-scraping