【发布时间】:2010-09-12 03:51:30
【问题描述】:
我需要找到一种方法来抓取我们公司的一个 Web 应用程序,并从中创建一个静态站点,该站点可以刻录到 cd 上,供旅行销售人员用来演示该网站。后端数据存储分布在很多很多系统上,因此简单地在销售人员笔记本电脑上的虚拟机上运行站点是行不通的。而且他们在某些客户端(没有互联网,手机......原始,我知道)时无法访问互联网。
是否有人对可以处理链接清理、flash、一点 ajax、css 等内容的爬虫有什么好的建议?我知道可能性很小,但我想在我开始编写自己的工具之前我会在这里提出这个问题。
【问题讨论】:
-
这只能从特定用户的角度工作。因此,爬虫需要以预先确定的用户身份进行身份验证,然后捕获该用户看到的所有内容。
标签: html web-crawler static-site