【发布时间】:2012-12-18 15:25:18
【问题描述】:
我想分析html页面的结构。对于一个页面,我将它作为一个字符串,我想去掉文本并只保留 html 结构。我不想使用 DOM 解析器,我需要一些健壮的东西,它不仅适用于 xhtml,而且适用于常规 html。我知道正则表达式足以从字符串中去除 html 标签,但是它们可以用来去除文本并只保留 html 标签吗?
您知道我可以使用的任何其他选项/框架吗?
【问题讨论】:
-
我肯定会使用 DOM 解析器...
-
我想避免 DOM 解析的原因是我想将生成的 html 用作字符串而不是 DOM。但是,我可以使用 DOM 解析器来剥离文本,然后将其作为字符串获取。这也有效,我只想知道我还有哪些其他选择。