【发布时间】:2013-01-05 07:07:13
【问题描述】:
我试图解析包含科学记数法(希腊语等)的页面。 这是page。请注意,还有其他页面需要解析更多符号。
例如它包含以下 HTML
<td> human Interleukin 1β </td>
&beta 对希腊字母进行编码。
但是用HTML::TableExtract解析后变成了:
human Interleukin 1\x{3b2}
有没有办法让下面的代码按原样捕获原始 HTML,
即维护1&beta。
use HTML::TableExtract;
use Data::Dumper;
# Local file for http://www.violinet.org/vaxjo/vaxjo_detail.php?c_vaxjo_id=55
my $file = "vaxjo_detail.php\?c_vaxjo_id\=50.html";
my $te = HTML::TableExtract->new();
$te->parse_file($file);
my ($table) = $te->tables;
print Dumper $table ;
【问题讨论】:
标签: html perl parsing html-table