【发布时间】:2014-06-08 17:13:16
【问题描述】:
我正在处理一些格式错误的 HTML,其中表格元素未包含在表格标记中,例如:
<div class="row">
<div class="large-12 columns main-content">
<tr>
<td colspan="4"><img src="../img/H006265.jpg"></td>
</tr><tr valign="top">
<td> </td>
</tr>
</div>
</div>
我想摆脱垃圾标签并最终得到这样的结果:
<div class="row">
<div class="large-12 columns main-content">
<img src="../img/H006265.jpg">
</div>
</div>
文档的其他地方有合法的表格,所以我不能完全剥离和标记,只有那些没有包含在标记中的表格。
我试过让 Nokogiri 解析它,认为它会清理不正确的 HTML,但无济于事:
Nokogiri::HTML::DocumentFragment.parse(badly_formed_html_string)
【问题讨论】:
-
您是否尝试过使用 XML 代替?至少要先清洁它