【问题标题】:JSOUP Document Structure issue HTMLJSOUP 文档结构问题 HTML
【发布时间】:2013-01-18 06:56:29
【问题描述】:
            String url = request.getParameter("url");
            Document doc = Jsoup.connect(url).get();
            Elements web = doc.childern.select("*");
            for(Element ele : web)
            {
                if(ele.hasText())
                ele.text("hello");

            }

当我打印文档时,它的重组就像 你好 你好 你好

而不是

                       <html>
                        <head>
                         <title>
                         hello
                         </title>
                         <body>
                             hello
                           </body>
                          </html>

【问题讨论】:

    标签: java html html-parsing jsoup


    【解决方案1】:

    但问题出在哪里?

    如果您想从您的编辑中排除head-tag,您可以使用这个:

    Elements web = doc.body().select("*");
    

    这只会为您提供您现在可以更改的主体元素。

    【讨论】:

    • 问题是解析标签后的结构不正确,如 而是它会像
    • 尤其是&lt;html&gt;&lt;/html&gt; 对我来说看起来很奇怪。您使用的是什么版本的 Jsoup(当前是 1.7.2)?作为测试,请在您的文档中调用normalise()-方法。
    • 你用的是什么版本的jsoup?
    猜你喜欢
    • 1970-01-01
    • 2015-06-06
    • 2013-07-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-09-02
    • 1970-01-01
    相关资源
    最近更新 更多