【发布时间】:2010-09-20 00:54:29
【问题描述】:
是否有一个 Perl 模块可以获取 糟糕的 HTML(例如从 Microsoft Word 复制的内容)并将其解析为 格式良好的 HTML?我看过 HTML::Tidy,但它得到了horrible reviews on CPAN。我们有一个自定义的遗留模块,它基本上是命令行版本 tidy 的包装器(这似乎几乎是 HTML::Tidy 的样子),但它会将文件写入磁盘并将它们读回,这可能是一个很大的性能惩罚。当然,凭借 Perl 出色的文本解析能力,还有更好的方法来做到这一点吗?
【问题讨论】:
标签: html perl module tidy rich-text-editor