TimedeltaIndexes 表示固定的时间跨度。它们可以添加到 Pandas 时间戳中,以固定数量递增。他们的行为从不取决于时间戳是否是工作日。
TimedeltaIndex 本身从不知道工作日。
由于最终目标是计算 DatetimeIndex 和 Timestamp 之间的天数,因此我会寻找另一个方向而不是转换为 TimedeltaIndex。
不幸的是,日期计算相当复杂,并且出现了许多数据结构来处理它们——Python datetime.dates、datetime.datetimes、Pandas Timestamps、NumPy datetime64s。
他们各有长处,但没有一个人能胜任所有用途。到
利用他们的优势,有时需要在两者之间转换
这些类型。
要使用np.busday_count,您需要将 DatetimeIndex 和 Timestamp 转换为
某些类型np.busday_count 可以理解。你所说的笨拙是代码
需要转换类型。假设我们想使用 np.busday_count,这是没有办法的——而且我知道没有比 np.busday_count 更好的工具来完成这项工作。
所以,虽然我认为没有更简洁的方法来计算工作日
比您建议的方法,还有一种性能更高的方法:
转换为 datetime64[D]'s 而不是 Python datetime.date 对象:
import pandas as pd
import numpy as np
drg = pd.date_range('2000-07-31', '2015-08-05', freq='B')
timestamp = pd.Timestamp('2015-08-05', 'B')
def using_astype(drg, timestamp):
A = drg.values.astype('<M8[D]')
B = timestamp.asm8.astype('<M8[D]')
return np.busday_count(A, B)
def using_datetimes(drg, timestamp):
A = [d.date() for d in drg]
B = pd.Timestamp('2015-08-05', 'B').date()
return np.busday_count(A, B)
对于上面的示例,这比上面的示例快 100 倍以上(len(drg) 接近 4000):
In [88]: %timeit using_astype(drg, timestamp)
10000 loops, best of 3: 95.4 µs per loop
In [89]: %timeit using_datetimes(drg, timestamp)
100 loops, best of 3: 10.3 ms per loop
np.busday_count 无论如何都会将其输入转换为datetime64[D]s,因此避免这种与datetime.dates 的额外转换更为有效。