【问题标题】:Python pandas unique values on chunksized filePython pandas在chunksized文件上的唯一值
【发布时间】:2020-04-14 20:51:48
【问题描述】:

嗨,我有一个巨大的 tsv 文件需要处理,所以我需要对其进行分块,所以我使用了这样的代码

MyList = []
Chunksize = 1000000
for chunk in pd.read_csv("wiki_editor_months.201508.tsv", sep="\t", chunksize=Chunksize):
    MyList.append(chunk)

然后我想在其中一列(wiki)中搜索唯一值,我唯一的想法就是这段代码

MyList[0].wiki.unique()

使用这段代码有点问题,因为一次我只能搜索一个块(其中有 43 个),然后在不同的块中有重复,有没有人知道如何在这个块大小的文件上使用 .unique 而不是一次一大块?

【问题讨论】:

    标签: pandas unique chunks


    【解决方案1】:

    看看这是否能解决你的问题。

    unique_values = set()
    chunk_size = 1000000
    for chunk in pd.read_csv("wiki_editor_months.201508.tsv", sep="\t", chunksize=chunk_size):
        unique_values = unique_values | set(chunk.wiki.unique())
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-12-21
      • 2015-03-15
      • 2017-06-12
      • 2014-01-25
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多