【发布时间】:2011-06-23 05:11:43
【问题描述】:
所以我仍在研究这个解析器。今天我发现了一个带有标签<st1:place w:st="on">的文档,Google 告诉我这是一个 Microsoft Office 智能标签。
我想摆脱这些东西,但我找不到它们是什么或有多少的列表?
如果它们都遵循<...:...> 模式,那么使用正则表达式很容易删除。
该文档没有doctype和.jsp扩展名,但所有内容都在两个<html>标签之间,无论野兽多么不标准,我仍然需要解析它。
好的,这实际上不是一个大问题,但它会影响我的格式并让我感到困惑。
【问题讨论】:
-
甚至 Jeff Atwood 也报道了这一点:codinghorror.com/blog/2006/01/cleaning-words-nasty-html.html
标签: php html parsing smart-tags