【发布时间】:2016-11-18 16:06:09
【问题描述】:
所以,我一直在尝试将一些查询导出并过滤到 MySQL 数据库到 JSON 文件,并且在我尝试了所有方法以在我用来导出的“代码”中修复这个问题之后,我无法修复它.
文本部分看起来不错,除了替换为\u00x 值的西班牙字符(主要是重音符号),例如:
[{..., "lang_tweet": "es", "text_tweet": "Recuerdo un d\u00eda de, *llamada a la 1:45*, \"Micho... Que me muero.!!\",...},...]
所以我的问题是直接我是否可以获取此 JSON 文件,对其进行处理并修复错误?如果它存在一种方式,我该怎么做?任何帮助将不胜感激,因为我从昨天开始就有这个错误,我需要尽快修复它。
查看我要修复的 JSON 完整文件: https://github.com/Vichoko/real-time-twit/blob/master/auto_labeling/json/tweets_sismos/test2.json
【问题讨论】:
-
绝对这里没有错。
-
谢谢@deceze,我会看看那个参考,同时让我告诉你我发现这些字符串是错误的,因为我需要用它们来训练分类器,所以我需要口音字符,而不是那些封顶字符。我不习惯管理
\u00x字符 -
只需使用符合标准的 JSON 解析器以您选择的编程语言解码您的 JSON,完成。
-
@deceze 谢谢你的帮助,伙计。看,我正在使用 python
json.load(file)导入 JSON 文件,解析后的 dict 中的字符串在这里也显示了错误的字符,但它们明显不同,正如您在此处看到的那样:u'text_tweet': u'Recuerdo un d\xeda de, *llamada a la 1:45*, "Micho... Que me muero.!!"'我已经阅读了参考但是还不知道如何解决它,抱歉,我很难理解编码。 -
不同的问题。就 JSON 而言,数据完全正确。
标签: json database string dictionary encoding