【发布时间】:2022-01-21 03:53:34
【问题描述】:
我正在从网站获取数据,这是我检索到的句子的示例:PHA+Q29ycmlnJmVhY3V0ZTtzIGV4ZXJjaWNlcyBlbnRyYWluZW1lbnQgY2hhcGl0cmUgbW91dmVtZW50IGV0IGZvcmNlczwvcD4K
这句话是用base64编码的,所以我想把它解码,然后用python把它编码回utf-8:
import base64
sentence = "PHA+Q29ycmlnJmVhY3V0ZTtzIGV4ZXJjaWNlcyBlbnRyYWluZW1lbnQgY2hhcGl0cmUgbW91dmVtZW50IGV0IGZvcmNlczwvcD4K"
base64.b64decode(sentence).decode("utf-8")
问题是它看起来像这样:"Corrigés exercices entrainement chapitre mouvement et forces",而不是像这样:"Corrigés exercices entrainement chapitre mouvement et forces"。
如您所见,口音完全搞砸了。
我正在使用 python 3
我无法使用 API 访问解码后的句子(我只有 base64 编码的句子)。
感谢您的帮助。
【问题讨论】:
-
您正确地从 Base64 获取明文。但是,该明文包含 HTML 实体;见Decode HTML entities in Python string?。