【发布时间】:2015-12-05 05:13:27
【问题描述】:
我正在尝试使用 JSoup 从网站上抓取“文本”。我可以清晰地获取文本(根本没有格式,只有文本),或者仍然附加所有格式(即
以及
和
)。但是,我似乎无法让格式化的版本在任何程度上包含
,这是唯一特别要求与文本一起使用的内容。
例如,我可以得到这个:
<p><br>Worldwide database</p>
还有这个:
Worldwide database
但我无法得到这个,这是我想要的结果:
Worldwide database<br/>
我在通过 Firefox 上的 FireBug 插件查看 HTML 代码时没有看到任何
,所以我想知道这是否是问题所在?或者我在代码中使用的提取文本的方法可能存在问题?
无论如何,这是我的代码:
Elements descriptionHTML = doc.select("div[jsname]"); // <-- Get access to the text w/ JSoup
String descText = descriptionHTML.text(); // <-- Get the code w/o any formating at all
// This prints out the desired text with the <p><br> and </p>, but no <br/>
for (Element link : descriptionHTML)
{
String jsname = link.attr("jsname");
if( jsname.equals("C4s9Ed")){
System.out.println(link);
break;
}
}
我真的很感激这个问题的任何帮助。
谢谢, 杰克
【问题讨论】:
-
能否包含您正在阅读 HTML 的网址?
标签: java html web-scraping jsoup screen-scraping