【发布时间】:2018-02-22 03:01:46
【问题描述】:
我正在尝试使用 Jsoup 解析 HTML 文件。 HTML 中的某些文本不属于标签。
<li class="inactive">
<span class="status label">inactive</span>
<a href="/officers/144662696" class="officer inactive" title="more info on MILLTOWN CORPORATE SERVICES">
MILLTOWN CORPORATE SERVICES
</a>
member,
<span class="status label">inactive</span>
<a href="/companies/us_wv/193180" class="company inactive revoked_(failure_to_file_annual_report)" title="More Free And Open Company Data On EASTBRIDGE L.L.C. (West Virginia (US), 193180)">
EASTBRIDGE L.L.C.
</a>
(West Virginia (US),
<span class="start_date">25 May 2000</span>-<span class="end_date"> 1 Aug 2002</span>)
</li>
我能够读取标签中的所有内容,但我正在尝试获取值 (美国西弗吉尼亚州) 和 member。
有没有办法在类之外和li 标记内获取值。
【问题讨论】:
-
不确定jsoup,但是可以尝试获取元素的
innerHTML。寻找暴露元素的html而不是文本值的api -
我已经使用 Jsoup 提取了所有其他字段。但我会尝试获取 innerHTML。
标签: java html parsing jsoup html-parsing