【问题标题】:How to parse one html page and take out text using class name or id of a html tag?如何解析一个 html 页面并使用 html 标签的类名或 id 取出文本?
【发布时间】:2017-08-19 05:34:15
【问题描述】:

我想解析一个 html 页面并使用类名或 html 标记的 id 取出文本。

Apache tika 还是 jsoup?建议我使用 html 页面的特定标签、id 或类名来操作和取出文本的任何工具名称。

【问题讨论】:

  • 我不确定tikaJsoup 肯定会如您所愿。

标签: html web-crawler jsoup html-parsing apache-tika


【解决方案1】:

我用Jsoup给你做了三个用例的例子,请看代码中的cmets:

  • 按类名获取div元素
  • 通过标签名获取所有div元素
  • 通过id获取元素
String html = "...";
Document doc = Jsoup.parse(html);

// get div elements by class name 
Elements divs = doc.select("div.myclass");
for (Element div : divs) {
    // print containing text
    System.out.println(div.text());
}

// get all div elements by tag name
divs = doc.getElementsByTag("div");
for (Element div : divs) {
    // print containing text
    System.out.println(div.text());
}

// get element by id
String id = "...";
Element element = doc.getElementById(id);
System.out.println(element.text());

【讨论】:

  • 感谢您的代码.. 将检查并标记此答案.. @flavio-donze
猜你喜欢
  • 2012-05-26
  • 2017-04-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-04-09
  • 2011-10-28
  • 2016-07-23
  • 2020-03-27
相关资源
最近更新 更多