【问题标题】:How to handle unicode of an unknown encoding in Django?如何在 Django 中处理未知编码的 unicode?
【发布时间】:2009-04-07 05:18:27
【问题描述】:

我想使用 Django ORM 包装器将一些文本保存到数据库中。问题是,这个文本是通过抓取外部网站生成的,而且很多时候它们似乎以错误的编码列出。我想存储原始字节,以便随着时间的推移改进我的编码检测,而无需重做刮擦。但 Django 似乎希望所有内容都存储为 unicode。我能以某种方式解决这个问题吗?

【问题讨论】:

    标签: python django unicode


    【解决方案1】:

    例如,您可以存储编码为 base64 的数据。或者尝试从浏览器分析 HTTP 标头,从那里获得正确的编码可能更简单。

    【讨论】:

    • 部分网站只是错误地编码了他们的数据或整个页面的编码不一致。不过,我仍然想存储原始数据,以便我可以返回并准确查看。
    【解决方案2】:

    用数据创建一个文件。使用 Django models.FileField 保存对文件的引用。

    不,它不涉及大量 I/O。如果你的文件很小,它会增加 2 或 3 个 I/O(目录读取、iNode 读取和数据读取。)

    【讨论】:

      猜你喜欢
      • 2017-01-21
      • 1970-01-01
      • 1970-01-01
      • 2017-03-12
      • 1970-01-01
      • 2011-11-02
      • 2014-12-05
      • 2013-12-10
      • 2014-02-26
      相关资源
      最近更新 更多