【发布时间】:2009-04-07 05:18:27
【问题描述】:
我想使用 Django ORM 包装器将一些文本保存到数据库中。问题是,这个文本是通过抓取外部网站生成的,而且很多时候它们似乎以错误的编码列出。我想存储原始字节,以便随着时间的推移改进我的编码检测,而无需重做刮擦。但 Django 似乎希望所有内容都存储为 unicode。我能以某种方式解决这个问题吗?
【问题讨论】:
我想使用 Django ORM 包装器将一些文本保存到数据库中。问题是,这个文本是通过抓取外部网站生成的,而且很多时候它们似乎以错误的编码列出。我想存储原始字节,以便随着时间的推移改进我的编码检测,而无需重做刮擦。但 Django 似乎希望所有内容都存储为 unicode。我能以某种方式解决这个问题吗?
【问题讨论】:
例如,您可以存储编码为 base64 的数据。或者尝试从浏览器分析 HTTP 标头,从那里获得正确的编码可能更简单。
【讨论】:
用数据创建一个文件。使用 Django models.FileField 保存对文件的引用。
不,它不涉及大量 I/O。如果你的文件很小,它会增加 2 或 3 个 I/O(目录读取、iNode 读取和数据读取。)
【讨论】: