【发布时间】:2017-08-19 05:34:15
【问题描述】:
我想解析一个 html 页面并使用类名或 html 标记的 id 取出文本。
Apache tika 还是 jsoup?建议我使用 html 页面的特定标签、id 或类名来操作和取出文本的任何工具名称。
【问题讨论】:
-
我不确定
tika但Jsoup肯定会如您所愿。
标签: html web-crawler jsoup html-parsing apache-tika
我想解析一个 html 页面并使用类名或 html 标记的 id 取出文本。
Apache tika 还是 jsoup?建议我使用 html 页面的特定标签、id 或类名来操作和取出文本的任何工具名称。
【问题讨论】:
tika 但Jsoup 肯定会如您所愿。
标签: html web-crawler jsoup html-parsing apache-tika
我用Jsoup给你做了三个用例的例子,请看代码中的cmets:
- 按类名获取div元素
- 通过标签名获取所有div元素
- 通过id获取元素
String html = "...";
Document doc = Jsoup.parse(html);
// get div elements by class name
Elements divs = doc.select("div.myclass");
for (Element div : divs) {
// print containing text
System.out.println(div.text());
}
// get all div elements by tag name
divs = doc.getElementsByTag("div");
for (Element div : divs) {
// print containing text
System.out.println(div.text());
}
// get element by id
String id = "...";
Element element = doc.getElementById(id);
System.out.println(element.text());
【讨论】: