【发布时间】:2016-09-22 16:16:40
【问题描述】:
我正在尝试编写一个网络蜘蛛从html页面中提取文本,我使用Jsoup来解析html,简单的代码如下:
File file = new File("test2.html");
Document doc = Jsoup.parse(file, "utf-8");
System.out.println(doc.select("body").text());
如下所示的test2.html:
hellothis is a simple testtest link
<!-- test here -->
<ul>
<li>test1</li>
<li>test2</li>
<li>test3</li>
<li>test4</li>
<li>test5</li>
<li>test6</li>
</ul>
似乎 Jsoup 将 textarea 中的代码作为所有文本。
如何删除所有的html标签,只保留真实的文本?
【问题讨论】:
-
行为是正确的。您可以再次解析textarea中的文本。