【发布时间】:2017-03-18 21:05:17
【问题描述】:
我是 python 新手,可以使用我能获得的任何帮助。我在 win7 机器上使用 python 3.5 (anaconda)
我正在尝试遍历文件夹中的多个 CSV 文件 (10k +),检查该文件中是否有任何超过预定义阈值的值。
我想使用文件名的子字符串作为名称字段的唯一标识符来构建字典或列表/元组(基本上最类似于 sql 表),并有另一列包含文件总数具有超过给定阈值的值。
我不希望你们中的任何人为我这样做,因为这是一种很好的做法,但如果有任何关于模块的建议可以使这更容易一些,我将不胜感激。
我已经能够检查一个文件的值,但是这个任务只进行了大约 10 分钟,我不确定如何遍历多个文件并构建表等。谢谢!
import numpy as np
path = 'C:\\path'
file = 'file.csv'
with open(path+file) as f:
my_data = np.genfromtxt(path+file, delimiter = ",")
for data in my_data:
if -1 in my_data:
print("it sure is")
【问题讨论】:
-
从一小部分文件开始;让负载和检查工作良好的一个文件。然后只需遍历文件并收集数据。字典,也许是
defaultdict也是开始收集的好地方。但是只有几个 K 文件,数据结构并不是什么大问题。在这一点上,您的描述太模糊,无法提出更具体的建议。 -
感谢@hpaulj,感谢您的意见。
标签: python-3.x pandas numpy genfromtxt