【发布时间】:2011-01-08 02:24:33
【问题描述】:
使用 Java,我需要保存一个完整的网页(包括其所有内容,如图像、css、javascript 等),就像我们如何使用另存为 - > 使用 HttpClient lib 的完整网页选项一样。我该怎么做?
【问题讨论】:
使用 Java,我需要保存一个完整的网页(包括其所有内容,如图像、css、javascript 等),就像我们如何使用另存为 - > 使用 HttpClient lib 的完整网页选项一样。我该怎么做?
【问题讨论】:
你可以试试 lib curl java http://curl.haxx.se/libcurl/java/
你也可以参考这个讨论 curl-equivalent-in-java
【讨论】:
您必须编写一个应用程序来获取 html 文件,对其进行解析并提取所有引用,然后获取通过解析找到的所有文件。
【讨论】:
这并不容易,因为某些 CSS/JS/Images 文件路径可能是“隐藏的”。只需考虑以下示例:
<script type="...">
document.write("&bla;script" + " type='...' src='" + blahBlah() + "'&bla;" + "&bla;/script&bla;");
</script>
但是,获取页面源、解析 URL 搜索并下载已创建的 URL 几乎是您可能需要的一切。
【讨论】: