【发布时间】:2018-04-18 22:18:59
【问题描述】:
我正在获取一个网页的正文,其中有一个包含很多行的表格,如下所示:
...
...
<tbody>
<tr class="odd">
<td align="center">08:00</td>
<td align="center">9.50</td>
<td>Description of event 1 </td>
<td align="center">7.80</td>
</tr>
<tr class="even">
<td align="center">09:00</td>
<td align="center">11.10</td>
<td>Description of event 2</td>
<td align="center">27.40</td>
</tr>
...
我想从该表中剪切部分并将其解析为我的对象。我试图使用子字符串,但我不知道文本的所需部分在哪里。另外,我正在寻找正则表达式和不同的解析器。我该如何决定我的问题?谢谢
【问题讨论】:
-
你试过什么?另外,当你说“剪线”时,你的意思是
String#split吗? -
您应该使用 html 解析器。看看jsoup.org
标签: java string parsing substring html-parsing