【发布时间】:2016-07-14 09:12:43
【问题描述】:
我使用来自 LIWC(语言查询和字数统计)的数据丰富了 reddit cmets 的公共数据集。我有 60 个文件,大小为 600mb。现在的想法是上传到 BigQuery,将它们放在一起并分析结果。唉,我遇到了一些问题。
对于第一次测试,我有一个包含 200 行和 114 列的测试样本。 Here is a link to the csv i used
我首先在Reddit 上提问,fhoffa 提供了一个非常好的答案。问题似乎是 body_raw 列中的换行符 (/n),因为 redditors 经常将它们包含在他们的文本中。 BigQuery 似乎无法处理它们。
我尝试将已传输到存储的原始数据传输回 BigQuery,未经编辑,未触及,但同样的问题。 BigQuery 甚至无法处理来自 BigQuery 的原始数据...?
反正我在R等其他程序中打开csv没有问题,说明csv本身没有损坏或者schema不一致。所以 fhoffa 的命令应该摆脱它。
bq load --allow_quoted_newlines --allow_jagged_rows --skip_leading_rows=1 tt.delete_201607a myproject.newtablename gs://my_testbucket/dat2.csv body_raw,score_hidden,archived,name,author,author_flair_text,downs,created_utc,subreddit_id,link_id,parent_id,score,retrieved_on,controversiality,gilded,id,subreddit,ups,distinguished,author_flair_css_class,WC,Analytic,Clout,Authentic,Tone,WPS,Sixltr,Dic,function,pronoun,ppron,i,we,you,shehe,they,ipron,article,prep,auxverb,adverb,conj,negate,verb,adj,compare,interrog,number,quant,affect,posemo,negemo,anx,anger,sad,social,family,friend,female,male,cogproc,insight,cause,discrep,tentat,certain,differ,percept,see,hear,feel,bio,body,health,sexual,ingest,drives,affiliation,achieve,power,reward,risk,focuspast,focuspresent,focusfuture,relativ,motion,space,time,work,leisure,home,money,relig,death,informal,swear,netspeak,assent,nonflu,filler,AllPunc,Period,Comma,Colon,SemiC,QMark,Exclam,Dash,Quote,Apostro,Parenth,OtherP
输出是:
Too many positional args, still have ['body_raw,score_h...]
如果我从命令中删除“tt.delete_201607a”,我会收到我现在经常看到的相同错误消息:
BigQuery error in load operation: Error processing job 'xx': Too many errors encountered.
所以我不知道在这里做什么。我应该用 Python 摆脱 /n 吗?这可能需要几天时间(尽管我不确定,我不是程序员),因为我的完整数据集大约有 5500 万行。 或者你有什么其他想法?
【问题讨论】:
标签: google-bigquery