【发布时间】:2012-10-18 03:18:59
【问题描述】:
我想以编程方式执行此操作:
给定一个页面 URL,我需要获取页面上的所有链接。重要的是至少要获取3条链接信息:锚文本、href属性值、链接在页面上的绝对位置。
Java CSSBox 库是一个选项,但尚未完全实现(不能同时获取href 属性值,必须通过附加库如Jsoup 进行一些额外的映射)。更重要的是,CSSBox 库渲染页面非常慢。
似乎 Javascript 具有所有可用的功能,但我们必须将 javascript 代码注入页面并编写驱动程序以利用现有浏览器。 Python 和 Ruby 等脚本语言也对此提供支持。我很难找到最方便的工具。
【问题讨论】:
-
为什么不能是这样的解决方案? stackoverflow.com/questions/1080411/…
-
@AndréRicardo 谢谢,但我怎样才能得到链接的绝对位置?
-
那么也许这就是你要找的,一种加入 base_url 和 relative_url stackoverflow.com/questions/6499603/… 的方法
标签: browser html-parsing web-scraping html-rendering