【发布时间】:2019-12-29 03:16:02
【问题描述】:
让我们解析格式良好的 HTML。
让org.w3c.dom.html.HTMLLIElement 有一些子节点。
为什么\t\n 符号成为单独的节点?
例如图片。前两行 - <div/> 和里面的文本。后两行 - 节点Text(没有完全这样的标签)带有制表符和结束符。
【问题讨论】:
-
因为这些字符在 HTML 源代码中,那么为什么它们不在解析数据中呢?即使是这样的纯空白也可能很重要,因此解析器无法消除它们。
-
但是,它们不代表任何标签。它们不会影响浏览器中的内容。
-
空格可能会影响浏览器中的内容,例如如果 CSS
white-space: pre生效。
标签: java html-parsing w3c