【发布时间】:2014-04-04 03:10:32
【问题描述】:
我在使用 Beautiful Soup 和 Nokogiri 等工具进行网络抓取方面经验有限。
到目前为止,我在查找信息时的方法是首先检查 HTML 元素和 CSS 标记,然后应用选择器。虽然这可行,但网站之间的细微差异/变化会使代码无用。此外,在某些情况下,网站根本不将选择器标签添加到其 HTML 元素中,因此我曾经不得不求助于选择元素的样式属性的 hacky 方法。
如何设计一种可以跨多个站点工作的抓取工具?我知道解决方案将取决于上下文,但是这样做是否有一般的良好做法?在这个问题之前的一次采访中,我实际上被问到了,我不知道。
我尝试过用谷歌搜索,但我发现的大部分内容都没有超越基础知识,我不知道去哪里找。任何帮助将不胜感激。
【问题讨论】:
-
这取决于你要抓取什么内容。
-
“网站根本不将选择器标签添加到其 HTML 元素”是什么意思?
标签: javascript python html ruby web-scraping