【问题标题】:randomize date and month but preserve year and time interval随机化日期和月份,但保留年份和时间间隔
【发布时间】:2020-06-17 12:31:46
【问题描述】:

我正在处理多个文件中的大数据。这是一个更大问题的一部分,但为了简单起见,我将它分成几部分。

文件 1 存储在 df1 中,文件 2 存储在 df2 中。我有大约 12 个文件,每个文件有 300 万条记录。

df1 和 df2 都是相关的,但存储为单独的文件。

df1 = pd.DataFrame({'person_id': [1, 2, 3, 4, 5],
                        'date_birth': ['12/30/1961', '05/29/1967', '02/03/1957', '7/27/1959', '01/13/1971'],
                        'date_death': ['07/23/2017','05/29/2017','02/03/2015',np.nan,np.nan]})
df1['date_birth'] = pd.to_datetime(df1['date_birth'])
df1['date_death'] = pd.to_datetime(df1['date_death'])
df1['diff_birth_death'] = df1['date_death'] - df1['date_birth']
df1['diff_birth_death']=df1['diff_birth_death']/np.timedelta64(1,'D')


df2 = pd.DataFrame({'person_id': [1,1,1,2,3],
                    'visit_id':['A1','A2','A3','B1','B2'],
                    'diag_start': ['01/01/2012', '02/25/2017', '02/03/2015', '07/27/2016', '01/13/2011'],
                    'diag_end': ['05/03/2012','05/29/2017','03/03/2015','08/15/2016','02/13/2011']})
df2['diag_start'] = pd.to_datetime(df2['diag_start'])
df2['diag_end'] = pd.to_datetime(df2['diag_end'])
df2['diff_birth_diag_start'] = df2['diag_start'] - df1['date_birth']
df2['diff_birth_diag_end'] = df2['diag_end'] - df1['date_birth']
df2['diff_birth_diag_start']=df2['diff_birth_diag_start']/np.timedelta64(1,'D')
df2['diff_birth_diag_end']=df2['diff_birth_diag_end']/np.timedelta64(1,'D')

我想做的是

1) 随机化/移动 datemonth 值,但保留 year 组件和 time difference between events(在出生和死亡之间,在出生和 diag_start 之间,在出生和 diag_end 之间)

2)如何找到满足上述条件的每个主题的日期偏移值(添加/减去/随机化的天数)

在下面的示例中,我手动添加了偏移量。

person_id 1 = -10 days (incorrect value. you will see below as to why it's incorrect)
person_id 2 = 10 days
person_id 3 = 100 days
person_id 4 = 20 days
person_id 5 = 125 days

我希望我的输出如下所示

df1 - 全部正确 - 日期和月份偏移(保留年份和间隔)

df2 - 选择的偏移量不正确,导致年份发生变化。虽然间隔保持year 值已更改。

【问题讨论】:

  • 我不知道我是否理解了这个问题。你有一个日期时间,比如 2000-01-01,然后你想随机化月份和日期部分,这样 2000 不能改变,但其他部分可以,例如:2000-04-28。这是你想要的吗?
  • 是的。你说的对。但是您还应该记住事件之间的time interval。因为它是按时间顺序排列的
  • 我已经给出了time intervaldate_birth 作为对其他日期列的引用。如果你看到我的示例数据代码,你就会有一个想法
  • 这是否意味着间隔必须是正数,还是必须严格相同?示例:如果开始是 2000-01-01,结束事件是 2000-12-31?有一些有效的选项:1)不能随机化,因为这样做并保持间隔相同会改变开始年份或结束年份 2)仍然可以随机化,只要结束事件在开始事件之后,间隔仍然是正数并且两个日期仍然可以是 2000... 3) 只有开始年份和间隔必须相同,例如结束年份可以更改为 2001。
  • @MiguelAngelo - 你在现场.. 是的 2000-01-012000-12-31 是一个极端情况。我们可以坚持选项 1。我知道它可能不适用于像 2000-01-012000-12-31 这样的边缘情况,但它们发生的机会非常少。对于上面帖子中显示的非边缘情况,可以帮助我如何完成吗?

标签: python python-3.x pandas dataframe datetime


【解决方案1】:

如 cmets 中所述,您想要的是在某些限制条件下随机化两个 datetime 对象:

  1. 开始日期必须早于结束日期
  2. 开始日期和结束日期之间的时间间隔在随机化后必须保持不变
  3. 开始和结束年份必须保持不变(例如 2000-01-01 不能变为 1999-12-31)

为了解决这个问题,我的想法是在不改变年份的情况下找到开始数据可能的变化范围,然后在不改变年份的情况下找到结束日期可能的变化范围,最后将它们相交以获得适用于两个日期的变化范围。之后,最终范围内的任何随机值都不会改变任何限制日期的年份,并将保持区间不变。

我创建了一个实现此功能的函数。您将开始和结束日期时间对象传递给它,它会返回一个元组,其中这些日期根据限制随机化。

import datetime as dt
from random import random

def rand_date_diff_keep_year_and_interval(dt1, dt2):
    if dt1 > dt2:
        raise Exception("dt1 must be lesser than dt2")
    range1 = {
        "min": dt1.replace(month=1, day=1) - dt1,
        "max": dt1.replace(month=12, day=31) - dt1,
    }
    range2 = {
        "min": dt2.replace(month=1, day=1) - dt2,
        "max": dt2.replace(month=12, day=31) - dt2,
    }
    intersection = {
        "min": max(range1["min"], range2["min"]),
        "max": min(range1["max"], range2["max"]),
    }
    rand_change = random()*(intersection["max"] - intersection["min"]) + intersection["min"]
    return (dt1 + rand_change, dt2 + rand_change)

print(rand_date_diff_keep_year_and_interval(dt.datetime(2000, 1, 1), dt.datetime(2000, 12, 31)))
print(rand_date_diff_keep_year_and_interval(dt.datetime(2000, 5, 18), dt.datetime(2001, 8, 20)))

熊猫解决方案

要使用 Pandas DataFrame,我们需要调整之前的代码以使用系列而不是单个日期时间对象。逻辑几乎保持不变,但现在我们可以说是“按系列”做所有事情。另外,我使用numpy.random 生成一系列随机数,而不是只创建一个随机数并对所有行重复它......这样随机性会少很多。

import datetime as dt
import pandas as pd
import numpy.random as rnd

def series_rand_date_diff_keep_year_and_interval(sdt1, sdt2):
    if any(sdt1 > sdt2):
        raise Exception("dt1 must be lesser than dt2")
    range1 = {
        "min": sdt1.apply(lambda dt1: dt1.replace(month=1, day=1) - dt1),
        "max": sdt1.apply(lambda dt1: dt1.replace(month=12, day=31) - dt1),
    }
    range2 = {
        "min": sdt2.apply(lambda dt2: dt2.replace(month=1, day=1) - dt2),
        "max": sdt2.apply(lambda dt2: dt2.replace(month=12, day=31) - dt2),
    }
    intersection = {
        "min": pd.concat([range1["min"], range2["min"]], axis=1).max(axis=1),
        "max": pd.concat([range1["max"], range2["max"]], axis=1).min(axis=1),
    }
    rand_change = pd.Series(rnd.uniform(size=len(sdt1)))*(intersection["max"] - intersection["min"]) + intersection["min"]
    return (sdt1 + rand_change, sdt2 + rand_change)

df = pd.DataFrame([
        {"start": dt.datetime(2000, 1, 1), "end": dt.datetime(2000, 12, 31)},
        {"start": dt.datetime(2000, 5, 18), "end": dt.datetime(2001, 8, 20)},
    ])

df2 = pd.DataFrame(df)
df2["start"], df2["end"] = series_rand_date_diff_keep_year_and_interval(df["start"], df["end"])
print(df2.head())

多列 Pandas 解决方案

再看问题,事件序列中有很多列,它们都代表日期,其中一些代表 NaT 值(空日期)。如果我们想要应用相同的限制,并保持一系列事件中所有事件之间的相对距离,而不改变任何值的年份,并且也接受 NaT 列,我们必须改变一些事情。让我们直接进入代码,而不是列出更改:

import datetime as dt
import pandas as pd
import numpy.random as rnd
import numpy as np
from functools import reduce

def manyseries_rand_date_diff_keep_year_and_interval(*sdts):
    ranges = list(map(
        lambda sdt:
            {
                "min": sdt.apply(lambda dt: dt.replace(month=1,  day=1 ) - dt),
                "max": sdt.apply(lambda dt: dt.replace(month=12, day=31) - dt),
            },
        sdts
        ))
    intersection = reduce(
        lambda range1, range2:
            {
                "min": pd.concat([range1["min"], range2["min"]], axis=1).max(axis=1),
                "max": pd.concat([range1["max"], range2["max"]], axis=1).min(axis=1),
            },
        ranges
        )
    rand_change = pd.Series(rnd.uniform(size=len(intersection["max"])))*(intersection["max"] - intersection["min"]) + intersection["min"]
    return list(map(lambda sdt: sdt + rand_change, sdts))

def setup_diffs(df1, df2):
    df1['diff_birth_death'] = df1['date_death'] - df1['date_birth']
    df1['diff_birth_death'] = df1['diff_birth_death']/np.timedelta64(1,'D')

    df2['diff_birth_diag_start'] = df2['diag_start'] - df1['date_birth']
    df2['diff_birth_diag_end'] = df2['diag_end'] - df1['date_birth']
    df2['diff_birth_diag_start'] = df2['diff_birth_diag_start']/np.timedelta64(1,'D')
    df2['diff_birth_diag_end'] = df2['diff_birth_diag_end']/np.timedelta64(1,'D')

df1 = pd.DataFrame({'person_id': [1, 2, 3, 4, 5],
                        'date_birth': ['12/30/1961', '05/29/1967', '02/03/1957', '7/27/1959', '01/13/1971'],
                        'date_death': ['07/23/2017', '05/29/2017', '02/03/2015', np.nan,      np.nan]})
df1['date_birth'] = pd.to_datetime(df1['date_birth'])
df1['date_death'] = pd.to_datetime(df1['date_death'])

df2 = pd.DataFrame({'person_id': [1,1,1,2,3],
                    'visit_id':['A1','A2','A3','B1','B2'],
                    'diag_start': ['01/01/2012', '02/25/2017', '02/03/2015', '07/27/2016', '01/13/2011'],
                    'diag_end': ['05/03/2012','05/29/2017','03/03/2015','08/15/2016','02/13/2011']})
df2['diag_start'] = pd.to_datetime(df2['diag_start'])
df2['diag_end'] = pd.to_datetime(df2['diag_end'])
setup_diffs(df1, df2)

display(df1)
display(df2)

series_list = manyseries_rand_date_diff_keep_year_and_interval(
    df1['date_birth'], df1['date_death'], df2['diag_start'], df2['diag_end'])
df1['date_birth'], df1['date_death'], df2['diag_start'], df2['diag_end'] = series_list
setup_diffs(df1, df2)

display(df1)
display(df2)

这一次,我使用 Jupyter Notebook 来更好地可视化 DataFrame:

希望这会有所帮助!欢迎任何 cmets 和建议。

【讨论】:

  • 嗨@Miguel Angelo!感谢您的回复,点赞。我们如何将数据框传递给函数?因为我的输入数据超过百万行
  • 嘿...抱歉,忘记您使用的是 Pandas DataFrame。我在答案中添加了 Pandas 解决方案。
  • 感谢您的努力和时间。虽然我无法获得确切的输出,但我仍然标记为您的努力和时间的答案。欣赏它
  • 好的,谢谢,我将创建另一个帖子并在此处链接
  • 我又在看这个问题了……我以为只有两个日期,但有很多事件。我将尝试更新答案以反映这一点。在等式中添加更多日期并不难,它将是事件序列中所有日期范围的交集。
猜你喜欢
  • 2018-10-15
  • 2018-11-29
  • 2013-09-23
  • 2015-03-27
  • 2021-01-15
  • 1970-01-01
  • 2021-09-08
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多