【发布时间】:2018-12-05 17:26:36
【问题描述】:
我想知道在 python 3 上打开使用 tweepy 流式传输的大型 Twitter 文件的正确脚本是什么。我已将以下文件用于较小的文件,但现在我的数据收集超过 30GB+,我遇到了内存错误:
with open('data.txt') as f:
tweetStream = f.read().splitlines()
tweet = json.loads(tweetStream[0])
print(tweet['text'])
print(tweet['user']['screen_name'])
到目前为止,我一直无法在网上找到我需要的东西,因此非常感谢任何帮助。
【问题讨论】:
-
您的系统是否有足够的内存来一次将整个文件存储在内存中?如果没有,您需要分段读取和解析数据,并可能将中介存储到数据库中。
-
嘿斯蒂芬,感谢您的评论。不,我只有 16GB 的 RAM。人们通常如何分析超过 1TB 的长达一年的 Twitter 数据?你能建议一种方法来读取和解析部分数据吗?
-
见下面@RobBricheno 的回答。他或多或少总结了我会怎么做。