【发布时间】:2021-06-26 04:07:17
【问题描述】:
我有一个.csv 文件格式的大型数据集,大约 60 GB 的数据包含超过 60% 的数据在某些列和行中丢失,因为无法将这么大的文件直接读入 @ 987654322@,我只想使用pandas.read_csv 将特定列和非空行读入jupyter notebook。
如何做到这一点?
提前致谢!!
【问题讨论】:
标签: python python-3.x pandas dataframe
我有一个.csv 文件格式的大型数据集,大约 60 GB 的数据包含超过 60% 的数据在某些列和行中丢失,因为无法将这么大的文件直接读入 @ 987654322@,我只想使用pandas.read_csv 将特定列和非空行读入jupyter notebook。
如何做到这一点?
提前致谢!!
【问题讨论】:
标签: python python-3.x pandas dataframe
在之前的帖子中关注suggestion。
pandas 文档建议您可以读取 csv 文件,仅选择您想要读取的列。
import pandas as pd
df = pd.read_csv('some_data.csv', usecols = ['col1','col2'], low_memory = True)
【讨论】:
您可以逐块读取 CSV 文件并保留您想要的行
iter_csv = pd.read_csv('sample.csv',, usecols = ['col1','col2'] iterator=True, chunksize=10000,error_bad_lines=False)
data = pd.concat ([chunk.dropna(how='all') for chunk in iter_csv] )
【讨论】: