【发布时间】:2009-07-22 19:54:07
【问题描述】:
我已经接管了一个代码库,我必须阅读这些由 Microsoft Word 生成的 html 文件,我认为它具有各种古怪的内联格式。
无论如何都可以解析出所有错误的内联格式并从该流中获取文本。我基本上想要一个程序化的净化器,这样我就可以应用一些合理的 css
【问题讨论】:
我已经接管了一个代码库,我必须阅读这些由 Microsoft Word 生成的 html 文件,我认为它具有各种古怪的内联格式。
无论如何都可以解析出所有错误的内联格式并从该流中获取文本。我基本上想要一个程序化的净化器,这样我就可以应用一些合理的 css
【问题讨论】:
您应该使用HTML Tidy - 它在清理 HTML 时是独一无二的。有一个article on DevX that describes how to do it from .NET。
【讨论】:
最后我只写了一个小类,做了一堆查找和替换。不漂亮,但它有效。
【讨论】: