【发布时间】:2016-10-28 13:15:50
【问题描述】:
所以我有一个程序可以读取 json,将其展平并转储 csv:
import json
import unicodecsv as csv
import sys
import glob
import os
from flatten_json import flatten_json
def createcolumnheadings(cols):
#create column headings
columns = cols.keys()
columns = list( set( columns ) )
return columns
doOnce=True
path=os.chdir(sys.argv[1])
for f in glob.glob("smallR.txt"):
fName=os.path.splitext(f)[0]
out_file= open( 'csv/' + fName+'.csv', 'wb' )
csv_w = csv.writer( out_file, delimiter="\t", encoding='utf-8' )
with open(f, 'r') as handle:
for line in handle:
data = json.loads(line)
flatdata =flatten_json(data)
if doOnce:
columns=createcolumnheadings(flatdata)
columns.insert(0,'racism')
csv_w.writerow( columns)
doOnce=False
flatdata['racism']= 0
csv_w.writerow(flatdata.get(x, u'') for x in columns)
这工作正常,有一个问题。 我的程序只是从 smallR.txt 中的第一行获取列标题(加上它添加了一个“种族主义”列)。
后面的一些数据(smallR.txt here)有不同的列。这会导致输出不太正确,请参阅 small.csv here。
是否有一种简单的方法可以调整我的程序以处理在后面的行中发现的新列标题?
【问题讨论】: