【问题标题】:JSON files with encoding problems at the strings (Accent characters like \u00xx) [duplicate]字符串中存在编码问题的 JSON 文件(重音字符,如 \u00xx)[重复]
【发布时间】:2016-11-18 16:06:09
【问题描述】:

所以,我一直在尝试将一些查询导出并过滤到 MySQL 数据库到 JSON 文件,并且在我尝试了所有方法以在我用来导出的“代码”中修复这个问题之后,我无法修复它.

文本部分看起来不错,除了替换为\u00x 值的西班牙字符(主要是重音符号),例如:

[{..., "lang_tweet": "es", "text_tweet": "Recuerdo un d\u00eda de, *llamada a la 1:45*, \"Micho... Que me muero.!!\",...},...]

所以我的问题是直接我是否可以获取此 JSON 文件,对其进行处理并修复错误?如果它存在一种方式,我该怎么做?任何帮助将不胜感激,因为我从昨天开始就有这个错误,我需要尽快修复它。

查看我要修复的 JSON 完整文件: https://github.com/Vichoko/real-time-twit/blob/master/auto_labeling/json/tweets_sismos/test2.json

【问题讨论】:

  • 绝对这里没有错。
  • 谢谢@deceze,我会看看那个参考,同时让我告诉你我发现这些字符串是错误的,因为我需要用它们来训练分类器,所以我需要口音字符,而不是那些封顶字符。我不习惯管理 \u00x 字符
  • 只需使用符合标准的 JSON 解析器以您选择的编程语言解码您的 JSON,完成。
  • @deceze 谢谢你的帮助,伙计。看,我正在使用 python json.load(file) 导入 JSON 文件,解析后的 dict 中的字符串在这里也显示了错误的字符,但它们明显不同,正如您在此处看到的那样:u'text_tweet': u'Recuerdo un d\xeda de, *llamada a la 1:45*, "Micho... Que me muero.!!"' 我已经阅读了参考但是还不知道如何解决它,抱歉,我很难理解编码。
  • 不同的问题。就 JSON 而言,数据完全正确。

标签: json database string dictionary encoding


【解决方案1】:

正如@deceze 所说,JSON 是正确的。如果我在 Python 中这样做:

with open("file.json", "r") as readfile:
    data = json.load(readfile)

print(data[0][u'text_tweet'])

它正确地打印西班牙字符:

> Recuerdo un día de, *llamada a la 1:45*, "Micho... Que me muero.!!"

【讨论】:

    猜你喜欢
    • 2018-09-13
    • 1970-01-01
    • 2018-07-09
    • 1970-01-01
    • 2012-12-02
    • 2011-09-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多