【问题标题】:Parsing datetime strings containing nanoseconds解析包含纳秒的日期时间字符串
【发布时间】:2012-05-23 14:09:41
【问题描述】:

我有一些时间格式为 HH:MM::SS.nano_seconds 的日志文件(例如 01:02:03.123456789)。我想在 python 中创建一个日期时间,这样我就可以巧妙地计算时间(例如,计算时差)。 strptime 在 微秒 使用 %f 时效果很好。 Python datetime 和 time 模块真的不支持纳秒吗?

【问题讨论】:

  • @MikePennington 该问题涉及获取纳秒的时钟时间,而不是解析它们并独立于实际时钟对它们进行数学运算。
  • @Dougal,这个问题非常相关,因为他们指出纳秒时间精度需要平台支持,而大多数不需要。在那个问题中,还讨论了纳秒的字符串格式
  • @MikePennington 好吧,它并没有解决问题或给出难以解决的原因 - 只是说明了为什么标准日期时间方法不这样做。这个问题只需要抽象处理纳秒,不需要做任何涉及实际系统时间的事情。这是一个有用的链接,但不是重复的。
  • 也许是 PEP 564 的解决方案 - 添加具有纳秒分辨率的新时间函数(2017 年 10 月)python.org/dev/peps/pep-0564

标签: python datetime strptime time-precision


【解决方案1】:

您可以看到from the source datetime 对象不支持比微秒更精细的任何东西。正如 Mike Pennington 在 cmets 中指出的那样,这很可能是因为 computer hardware clocks aren't nearly that precise。维基百科说HPET 的频率“至少为 10 MHz”,这意味着每 100 纳秒一个滴答声。

如果您可以忍受丢弃最后三位数字(无论如何这可能没有太大意义),您可以通过将输入字符串切片为小数点后只有六位数字并使用 %f 解析来解析它.否则,您似乎必须自己实现减法。


稍后更新:numpy 和 pandas 现在都(有些不同)支持时间戳,包括跟踪纳秒的可能性,这通常是很好的解决方案。有关如何操作,请参阅其他答案。

Python 3.7+ 在time (PEP 564) 中也有time.time_ns 和相关函数,但在datetime 中仍然不支持纳秒。

【讨论】:

  • 系统时钟并不是人们可能想要使用 datetime 和 timedelta 的唯一时间来源。令人讨厌(近视白痴)他们没有使用 nsecs 而不是 usecs 来实现。
  • @travc: 有开放的 CPython 问题:datetime module has no support for nanoseconds
  • 到了2016年,这还是个问题。我同意@travc 的观点,不支持纳秒是愚蠢的,因为许多科学家在使用 Python 时需要这样的精度
  • @sirgogo,请注意 numpy 的 datetime64 dtype 支持低至阿秒(有点)。
  • 另见 PEP 564 - 添加具有纳秒分辨率的新时间函数(2017 年 10 月)python.org/dev/peps/pep-0564
【解决方案2】:

这是一个旧线程,但仍然......

您可以使用 Pandas 功能来实现这一点。我有像“2019-03-22T14:00:01.700311864Z”这样的时间戳,我通过以下方式转换为时间戳:

    firstStamp = pd.to_datetime(firstStampString, format='%Y-%m-%dT%H:%M:%S.%fZ')
    lastStamp = pd.to_datetime(lastStampString, format='%Y-%m-%dT%H:%M:%S.%fZ')

    deltaTime = lastStamp - firstStamp

这很好用。

【讨论】:

  • 这很明显,但我最初错过了它:如果您的日期时间字符串不包含“Z”后缀,您还应该从“格式”字符串中删除“Z”。
【解决方案3】:

numpy 可以很自然地使用纳秒甚至更精确的时间单位(ps、fs、as)。 Numpy有自己的Datetimes and Timedeltas实现,可以试试np.datetime64

import numpy as np
def str_to_ns(time_str):
     """
     input: time in a format `hh:mm:ss.up_to_9_digits`
     """
     h, m, s = time_str.split(":")
     int_s, ns = s.split(".")
     ns = map(lambda t, unit: np.timedelta64(t, unit),
              [h,m,int_s,ns.ljust(9, '0')],['h','m','s','ns'])
     return sum(ns)

那么你可以通过以下方式使用这个功能:

>>> src = "1:2:34.123456789"
>>> out = str_to_ns(src)
>>> print(out)
3754123456789 nanoseconds
>>> out / np.timedelta64(1,'h')
1.0428120713302778
>>> out / np.timedelta64(1,'m')
62.568724279816664
>>> out / np.timedelta64(1,'s')
3754.123456789

算术也是可能的:

>>> t1, t2 = str_to_ns("1:0:12.12345678"), str_to_ns("1:0:12.12")
>>> t1 - t2
numpy.timedelta64(3456780,'ns')

我同意这不是 自然的,但通过这种方式,您可以通过 numpy 实现任意高时间精度。

【讨论】:

    【解决方案4】:

    如果您实际上并不关心纳秒,但仍希望能够解析秒内小数点后超过 6 位的日期时间,则可以使用 python-dateutils 库。

    例如,尝试使用标准的 lib datetime 包:

    >>> from datetime import datetime
    >>> datetime.strptime('2021-02-14T02:27:57.96119078Z', '%Y-%m-%dT%H:%M:%S.%fZ')
    ValueError: time data '2021-02-14T02:27:57.96119078Z' does not match format '%Y-%m-%dT%H:%M:%S.%fZ'
    

    但是使用 python-dateutils,它实际上会解析它而不会抛出错误:

    >>> from dateutil.parser import isoparse
    >>> isoparse('2021-02-14T02:27:57.96119078Z')
    datetime.datetime(2021, 2, 14, 2, 27, 57, 961190, tzinfo=tzutc())
    

    请注意,它不会保留纳秒(也不会正确舍入 - 它只是在小数点后 6 位后截断),但它至少不会破坏解析 >6 位小数。

    【讨论】:

      【解决方案5】:
      def parse_nanodate(s):
        """
        parse date, ignore nanoseconds
        sample input: 2020-12-31T16:20:00.000000123Z
        --> 123ns will be ignored
        """
        if s[-1] == 'Z':
          # add explicit UTC timezone, to make strptime happy
          s += '+0000'
        return datetime.datetime.strptime(
          s[0:26]+s[29:], '%Y-%m-%dT%H:%M:%S.%fZ%z')
      
      

      【讨论】:

        猜你喜欢
        • 2020-08-27
        • 2015-12-25
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2010-10-16
        相关资源
        最近更新 更多