【发布时间】:2023-03-21 19:01:01
【问题描述】:
我正在从不同的网站抓取网页,它们有不同的编码。我得到的编码示例是 -
- Big5
- TIS-620
- utf-16le
- shift_JIS
- EUC-JP
- MacCyrillic
- koi8-r
除了更常见的编码。我可以通过使用上述编码解码得到网页的unicode源。
我的问题是:我想将所有文件存储为 utf8。如果我使用 utf8 对 unicode 源进行编码,它将适用于所有网页吗? utf8 是否支持所有 unicode 码位?
【问题讨论】:
-
名称中的“UTF”部分代表 Unicode 转换格式:任何“UTF-...”编码确实可以存储所有 Unicode 字符。
标签: python unicode encoding utf-8 character-encoding