【问题标题】:How to Enable HTML::TableExtract to Recognize Special Characters如何启用 HTML::TableExtract 以识别特殊字符
【发布时间】:2013-01-05 07:07:13
【问题描述】:

我试图解析包含科学记数法(希腊语等)的页面。 这是page。请注意,还有其他页面需要解析更多符号。

例如它包含以下 HTML

<td> human Interleukin 1&beta;        </td>

&amp;beta 对希腊字母进行编码。

但是用HTML::TableExtract解析后变成了:

human Interleukin 1\x{3b2} 

有没有办法让下面的代码按原样捕获原始 HTML, 即维护1&amp;beta

use HTML::TableExtract;
use Data::Dumper;

# Local file for http://www.violinet.org/vaxjo/vaxjo_detail.php?c_vaxjo_id=55
my $file = "vaxjo_detail.php\?c_vaxjo_id\=50.html";

my $te = HTML::TableExtract->new();
$te->parse_file($file);
my ($table) = $te->tables;
print Dumper $table ;

【问题讨论】:

    标签: html perl parsing html-table


    【解决方案1】:

    它没有返回

    human Interleukin 1\x{3b2} 
    

    返回

    human Interleukin 1β
    

    Dumper 只是将其打印为 Perl 字符串文字

    "human Interleukin 1\x{3b2}"
    

    无论如何,如果您想要原始 HTML 而不是它所代表的文本,我相信将 keep_html =&gt; 1 传递给构造函数就可以了。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-10-30
      • 1970-01-01
      • 2014-04-25
      • 1970-01-01
      • 1970-01-01
      • 2020-12-18
      • 2016-11-29
      • 2018-02-10
      相关资源
      最近更新 更多