【问题标题】:Offline HTTP explore with Java [closed]使用 Java 进行离线 HTTP 探索 [关闭]
【发布时间】:2013-07-03 17:03:38
【问题描述】:

我对如何请求 http 站点并离线浏览它们进行了一些研究;我发现这是一个可能的答案:

http://www.javaworld.com/jw-05-2000/jw-0518-offload.html

但问题是,它不是那么完整或直观。有没有人有我可以使用的关于这个主题的一个很好的文献资源?

提前致谢

【问题讨论】:

    标签: java http url httprequest offline-browsing


    【解决方案1】:

    使用JsoupJava HTML 解析器

    jsoup 是一个用于处理真实世界 HTML 的 Java 库。它提供 一个非常方便的 API,用于提取和操作数据,使用 最好的 DOM、CSS 和类似 jquery 的方法。

    阅读内容就这么简单:

    Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
    Elements newsHeadlines = doc.select("#mp-itn b a");
    

    【讨论】:

    • 我得到了 jsoup 阅读文档的想法,但问题是,此连接方法打开连接并从 URL 获取对象和子对象,然后我需要处理保存部分我的高清?
    • @VictorOliveira JSoup 将整个 html 加载到 Document 对象中。您可以遍历该文档并获取节点。
    • 很抱歉,但我仍然不明白我将如何访问这个对象和他的内容。我不把它作为一个文件下载吗?
    • @VictorOliveira 文档对象有很多实用方法来读取页面的不同部分。查看本教程以了解它:mkyong.com/java/jsoup-html-parser-hello-world-examples
    • 我在这里考虑如何合并两种方式,因为我已经有了连接并将 html 下载到我的 HD..但问题是,我下载的 html 附带的链接是不是本地可访问的,因为我需要像 jsoup 这样的东西 - 或者我误解了什么? ||顺便说一句谢谢你的链接
    【解决方案2】:

    使用 Jsoup:

    Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
    Strin html=doc.html();
    //save html in a file
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2010-10-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多