【发布时间】:2018-09-24 13:47:47
【问题描述】:
我正在阅读两种非常相似的 csv 文件。 它们的长度大致相同,为 20 000 行。每条线代表每秒记录的参数。 因此,第一列是时间戳。
- 在第一个文件中,模式如下:2018-09-24 15:38
- 在第二个文件中,模式如下:2018-09-24 03:38:06 PM
在这两种情况下,命令都是一样的:
data = pd.read_csv(file)
data['Timestamp'] = pd.to_datetime(data['Timestamp'])
我检查了两行的执行时间:
- pd.read 在这两种情况下都同样有效
- 执行第二行代码需要大约 3 到 4 秒的时间
唯一的区别是日期模式。我不会怀疑的。你知道为什么吗?你知道如何解决这个问题吗?
【问题讨论】:
-
使用 pd.to_datetime 的
format参数来限制 Pandas 尝试猜测您输入的格式字符串。这将大大提高 to_datetime 的性能。
标签: python pandas string-to-datetime