【发布时间】:2009-08-18 21:32:56
【问题描述】:
我正在尝试将一堆 html 编码文本翻译成 utf-8 以将其放入我的数据库中。 html_entity_decode 或 Translit 的 iconv 都会遗漏大量字符。
我已经写了一长串要删除的字符,但现在我看到 &Yuml 没有被翻译,但 ÿ 是。
我敢肯定还有其他类似的符号被遗漏了。
对于如何最好地处理这些不一致有什么建议吗?并确保我正确翻译了每个字符?
【问题讨论】:
我正在尝试将一堆 html 编码文本翻译成 utf-8 以将其放入我的数据库中。 html_entity_decode 或 Translit 的 iconv 都会遗漏大量字符。
我已经写了一长串要删除的字符,但现在我看到 &Yuml 没有被翻译,但 ÿ 是。
我敢肯定还有其他类似的符号被遗漏了。
对于如何最好地处理这些不一致有什么建议吗?并确保我正确翻译了每个字符?
【问题讨论】:
任何形式为 &blah;是 (X)HTML 中的实体引用;如果您需要确保全部获得,请确保您的最终 UTF-8 输出中没有一个包含该模式。您还会发现很多末尾没有分号(但那里有很多误报)。
维基百科自然有一个list of HTML/XHTML/XML entity codes。您可以实施该(长)列表,并查看是否在野外找到任何其他列表。
【讨论】: