【发布时间】:2010-10-20 22:03:10
【问题描述】:
我正在寻找一种方法来检测文档中的字符集。我一直在这里阅读 Mozilla 字符集检测实现:
我还找到了一个名为 jCharDet 的 Java 实现:
这两个都是基于使用一组静态数据进行的研究。我想知道是否有人成功地使用了任何其他实现,如果是的话怎么办?您是否推出了自己的方法,如果是的话,您用于检测字符集的算法是什么?
任何帮助将不胜感激。我不是通过 Google 寻找现有方法的列表,也不是在寻找 Joel Spolsky 文章的链接 - 只是为了澄清:)
更新:我对此进行了大量研究,最终找到了一个名为 cpdetector 的框架,它使用可插入的方法进行字符检测,请参阅:
这提供了 BOM、chardet(Mozilla 方法)和 ASCII 检测插件。自己编写也很容易。还有另一个框架,它提供了比 Mozilla 方法/jchardet 等更好的字符检测...
为 cpdetector 编写自己的插件非常容易,它使用此框架提供更准确的字符编码检测算法。它比 Mozilla 方法更有效。
【问题讨论】:
-
这是一个棘手的问题。感谢您自己研究的重要链接。
-
是的,已经解决了记事本问题,一旦我完成并完成了一些有趣的东西,我将根据我的研究修改我的帖子......
-
Java 中还有另一个移植:code.google.com/p/juniversalchardet
-
juniversalchardet 看起来 6 年没有更新了; ICU 在今年早些时候进行了更新。