【发布时间】:2017-11-23 06:58:32
【问题描述】:
我使用 BeautifulSoup 通过 lxml 解析器解析 HTML。但是我遇到了一个在<table> 中没有任何结束标签的文件:
<table id='reportTable' class='report-table' style='width:auto' cellspacing='0'><tr>
<th>Номер<br>поезда<th>Дата<br>отправления<th>Маршрут<th>Причина<th>Комментарий<th>Станция ...
虽然<table> 标签已正确关闭。
【问题讨论】:
-
您是否已经尝试解析它但没有成功? html 解析器的一半意义在于它可以像浏览器一样容忍格式错误的 html。缺少结束标签不应出现问题
-
@C.Feenstra 它可以识别一些
tds,但通常无法拆分。稍后我会尝试制作一个示例文件
标签: python html beautifulsoup lxml