【发布时间】:2018-06-21 13:04:05
【问题描述】:
我有一个数据集,其中我有帐号和每次观察的“逾期天数”。对于每个帐号,只要“逾期天数”列达到“DLQ3”之类的代码,我就想删除该帐户的其余行(即使 DLQ3 是该帐户的第一个观察值)。
我的数据集如下所示:
Obs_month Acc_No OS_Bal Days_past_due
201005 2000000031 3572.68 NORM
201006 2000000031 4036.78 NORM
200810 2000000049 39741.97 NORM
200811 2000000049 38437.54 DLQ3
200812 2000000049 23923.98 DLQ1
200901 2000000049 35063.88 NORM
因此,对于帐户 2000000049,我想删除日期为 200812 之后的所有行,因为它现在是默认设置。
总而言之,我想查看帐户何时达到 DLQ3 以及何时删除第一次 DLQ3 观察后的所有行。
我尝试使用所有 DLQ3 观察值对数据进行子集化,并按升序对观察月份进行排序,并获得一个唯一的帐号列表,其中包含 DLQ3 及其达到 DLQ3 的第一个月。发布我认为我可以用原始数据做一些 left_join 并使用 ifelse 但流程是冒险的。
【问题讨论】:
-
你能缩进你的数据集吗?很难理解它的结构。 (突出显示数据,在 Mac 上按命令 K)
-
现在缩进了。
标签: r database bigdata data-modeling finance