【发布时间】:2021-02-24 04:29:00
【问题描述】:
我无法理解 cutoff_dates 概念。 我真正想要的是通过一个时间窗口计算不同的特征,比如 60 天前(没有当前事务),cutoff_dates 看起来像示例中的硬编码日期。 我正在为每一行使用时间索引(下面的 A_time),并根据此处what_is_cutoff_datetime 中的文档:
时间索引定义为第一次可以使用行中的任何信息。如果在计算特征时指定了截止时间,则时间索引值较晚的行将被自动忽略。
所以不清楚我是否不把截止日期计算到时间索引值之前。
这是我的实体集定义:
es = ft.EntitySet('payment')
es = es.entity_from_dataframe(entity_id='tableA',
dataframe=tableA_dfpd,
index='paymentIndex',
time_index='A_time')
es.normalize_entity(base_entity_id='tableA',
new_entity_id='tableB',
index='B_index',
additional_variables=['B_x','B_time'],
make_time_index='B_time')
es.normalize_entity(base_entity_id='tableA',
new_entity_id='tableC',
index='C_index',
additional_variables=["C_x","C_date"],
make_time_index="C_date")
es.normalize_entity(base_entity_id='tableA',
new_entity_id='tableD',
index='D_index',
additional_variables=["D_x"],
make_time_index=False)
Entityset: payment
Entities:
tableA [Rows: 310083, Columns: 8]
tableB [Rows: 30296, Columns: 3]
tableC [Rows: 206565, Columns: 3]
tableD [Rows: 18493, Columns: 2]
Relationships:
tableA.B_index -> tableB.B_index
tableA.C_index -> tableC.C_index
tableA.D_index -> tableD.D_index
我如何准确地进行窗口计算?我是否需要通过截止日期?到dfs方法? 我想使用基于 A_time 变量的所有窗口计算,直到当前交易的 60 天窗口,所以实际上每笔交易的截止日期是该交易的 time_A 值。,不是吗?
【问题讨论】:
标签: featuretools