【问题标题】:html_entity_decode characters like &Yuml vs &yumlhtml_entity_decode 字符,例如 &Yuml vs &yuml
【发布时间】:2009-08-18 21:32:56
【问题描述】:

我正在尝试将一堆 html 编码文本翻译成 utf-8 以将其放入我的数据库中。 html_entity_decode 或 Translit 的 iconv 都会遗漏大量字符。

我已经写了一长串要删除的字符,但现在我看到 &Yuml 没有被翻译,但 &yuml 是。

我敢肯定还有其他类似的符号被遗漏了。

对于如何最好地处理这些不一致有什么建议吗?并确保我正确翻译了每个字符?

【问题讨论】:

    标签: php character-encoding


    【解决方案1】:

    任何形式为 &blah;是 (X)HTML 中的实体引用;如果您需要确保全部获得,请确保您的最终 UTF-8 输出中没有一个包含该模式。您还会发现很多末尾没有分号(但那里有很多误报)。

    维基百科自然有一个list of HTML/XHTML/XML entity codes。您可以实施该(长)列表,并查看是否在野外找到任何其他列表。

    【讨论】:

    • 感谢 derobert,我希望有一种方法可以做到这一点,而无需经过这么长的列表(希望已经存在)。看起来我会为此进行清洁,我会为将来需要它的人发布该功能。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-06-02
    • 1970-01-01
    • 1970-01-01
    • 2012-11-04
    • 1970-01-01
    • 2011-06-06
    相关资源
    最近更新 更多