【问题标题】:Creating a permutation, with restrictions创建一个有限制的排列
【发布时间】:2014-11-13 11:57:22
【问题描述】:

我正在使用 Python、Pandas 和 Numpy,尽管这个问题感觉像是一个更通用的算法设计问题。

我有一个元素列表(实际上是一个数组),我想生成该列表的排列。但是,某些项目不允许位于列表中的某些位置。我想生成一个遵守这些限制的排列。有什么有效的方法来做到这一点?

我的实际用例是一个 Pandas 数据框,有两列 XYXY 都具有相同的编号,但顺序不同。数字不是唯一的。同一行的XY 中没有数字出现(即没有数字与自身匹配)。我想置换Y,同时保持没有数字与自身匹配的限制。我一直在 Y 上调用 Numpy 的 permute,但大约 1% 的结果行有 X==Y

用例子编辑:

import pandas as pd
import numpy as np

data = [[1,2],
        [1,4],
        [4,2],
        [2,3]]

df = pd.DataFrame(columns=['X', 'Y'],
              data=data)


df_permuted = df.copy()

df_permuted.Y = np.random.permutation(df.Y)

print(df.X==df.Y)
#0    False
#1    False
#2    False
#3    False
#dtype: bool

print(df_permuted.X==df_permuted.Y)
#0    False
#1    False
#2    False
#3     True
#dtype: bool

编辑: 明显的算法太慢/无法扩展,是这样的:

for every row i:  
 define the set of valid candidate "other" rows (where i.X != other.Y and i.Y != other.X)
 grab a row from the valid set
 swap i.Y and other.Y

在我们的 Pandas 示例中,这将是:

from numpy.random import choice
for i in df.index:
    other_rows = df[(df.ix[i].X != df.Y) * (df.ix[i].Y != df.X)]
    selected_row = choice(other_rows.index)
    original_Y = df.ix[i].Y
    df.ix[i].Y = df.ix[selected_row].Y
    df.ix[selected_row].Y = original_Y
print(df.X==df.Y)
#0    False
#1    False
#2    False
#3    False
#dtype: bool

问题是这太慢了,而且根本没有并行化。有没有办法并行化它?我想答案是“否”,因为在一行上进行的交换会影响下一行的有效“其他”。

编辑规模感: 大约 1.4*10^7 行,X 中有 2*10^6 个唯一值,Y 中有类似的数字。并且需要生成大约 10^3 个独立排列。我实际上采用多组行并独立排列它们的内容,有些组非常小(例如 10 行),但许多组相当大(10 ^ 5)。这买了一点帮助,但最后还是有很多行!只需在 10^7 行上运行一个简单的 np.random.permutation 大约需要 7 秒,这已经足够了。运行上面的受限置换算法(在 numpy 而不是 pandas 中实现以提高速度)只需 10^3 行就需要 7 秒。哎呀!

【问题讨论】:

  • 你能举个例子吗?
  • 使用permutation函数后过滤掉这些值是否足够?
  • 如何过滤?可能是排列过程匹配,例如所有的 2 给对方。然后只抓取那些 X==Y 的值并排列它们不会解决任何问题;得到的排列与之前的 2 相同。
  • 您说“X 和 Y 都具有相同的数字,但顺序不同”,但在您的示例中,Y 不包含 1,X 不包含 3,所以我不确定您是什么意思是。我认为您遇到的问题是:X 和 Y 是任意多重集,并且您想提出对,使得一侧的所有值构成 X,另一方面构成 Y,并且没有值与自身配对。对吗?
  • 并且要明确一点 - 你想要任何这样的配对,你并不是想公平地选择一个或任何东西。

标签: python algorithm numpy pandas permutation


【解决方案1】:

我希望我没有提出一个针对您的示例过于具体的解决方案。但是,如果可行,您可能会创建每个排列,然后删除与您的条件不匹配的排列。然后,您可以直接使用它,也可以从结果排列中随机抽样。

这是受您上面示例启发的代码。我意识到我使用的起始假设略有不同:

df = pd.DataFrame( list(itertools.product([1,2,3,4], [1,2,3,4])), columns = ['X','Y'])
print df


    X  Y
0   1  1
1   1  2
2   1  3
3   1  4
4   2  1
5   2  2
6   2  3
7   2  4
8   3  1
9   3  2
10  3  3
11  3  4
12  4  1
13  4  2
14  4  3
15  4  4

然后设置您感兴趣的标准:

print df[df.X != df.Y]

    X  Y
1   1  2
2   1  3
3   1  4
4   2  1
6   2  3
7   2  4
8   3  1
9   3  2
11  3  4
12  4  1
13  4  2
14  4  3

编辑: 我将把上述所有组合垃圾留在那里,因为其他人可能会觉得它很有用。但是在 cmets 中聊天后,我认为我有一个可能的解决方案。

您似乎可以进行排列,然后将排列后的数据帧分成两个子集:

  1. 不符合条件的数据(即 X==Y)
  2. 符合标准的数据 (X!=Y)

然后我们可以取第一个子集,然后简单地重新排列它。子集 1 应该比子集 2 小得多。我们只是递归地这样做,创建一组符合条件的记录应该非常容易和快速。

当然,我们必须处理只有一行匹配的情况。

我已经实现了一个示例解决方案:

设置一些与真实数据大小相似的播放数据:

np.random.seed(3)
n=14000000
df = pd.DataFrame({'X' : np.random.randint(2000000, size=n), 
                   'Y' : np.random.randint(2000000, size=n)})

示例数据将从一些重复的行开始,但这没关系。让我们创建 shuffle 函数:

def permuteDataFrame(inDf):
    permutedDf = pd.DataFrame({'X' : np.random.permutation(inDf.X), 
                               'Y' : np.random.permutation(inDf.Y)})
    # check for dupes
    clash = permutedDf[permutedDf.X == permutedDf.Y] 
    if clash.shape[0] > 1: #repermuting can't work if only one row has a match
        clash = permutedDf[permutedDf.X == permutedDf.Y].copy()
        noclash = permutedDf[permutedDf.X != permutedDf.Y].copy()
        # recursion FTW: run the clashes back through this algo
        clash = permuteDataFrame(clash)
        permutedDf = pd.concat([clash, noclash ])
    if clash.shape[0] == 1: # handle the single match problem
        # solving the single match by grabbing the single match plus a random other record and permuting
        # get the vector of bools that indicate matches
        clashIndex = permutedDf.X == permutedDf.Y
        # randomly make another one True
        ilocToSwap = np.random.randint(permutedDf.shape[0]) # random record location to swap
        indexOfClashes.iloc[ilocToSwap] = True
        clash = permutedDf[indexOfClashes]
        # recursion FTW: run the clashes back through this algo
        clash = permuteDataFrame(clash)
        permutedDf = pd.concat([clash, noclash ])
    return permutedDf

在我的 Mac 上,一个简单的排列需要 5.3 秒。新的permuteDataFrame() 函数需要 5.8 秒。即使在您的机器上花费 8 秒,您也将在 2.2 小时内获得 1000 个。那可能行得通。

【讨论】:

  • 这是一个有趣的开始!如果由于内存限制而无法枚举每个排列,我们将如何修改它?
  • 突然想到:1) 置换子集 2) 构建一个循环来置换和检查条件,然后将结果写入文件。这样,一次只有一个条件在内存中。如果您以后想要随机结果,您可以打开文件,计算行数,随机选择一行。我想这取决于用例。
  • 我刚刚阅读了您问题中添加的 cmets,我怀疑您得到的答案无济于事,因为回答者无法理解您的问题的规模。你能以某种方式分享问题的数量级吗?真正的问题是 100 个变量,每个变量有 30 个值吗? 1000 x 300? 100 x 3e10?我认为答案确实受到您的规模的限制。
  • 谢谢!已添加到帖子中。
  • 是的,我对“全部计算”的回答不适合您的问题。而且做一个循环太慢了。因此,我们需要以某种方式将其表述为一个 numpy 问题,以获得 numpy 速度的好处。以某种方式使用 numpy 逻辑计算然后测试?
【解决方案2】:

你为什么不做你正在做的事情(排列 Y),但最后只是检查以确保没有匹配:

if (df.X == df.Y).any():
    reject_dataframe()

【讨论】:

  • 如果坏行几乎不可能消失,那么这可能会奏效。但是,没有坏行的可能性很小。在我的用例中,我说“大约 1% 的结果行有 X==Y”。所以只要重新掷骰子直到我得到一个有效的结果就需要很长时间。
  • 哦,我完全看错了。我以为你说的是​​ 1% 的数据帧,而不是行。是的,这需要很长时间,对此感到抱歉。
猜你喜欢
  • 2018-04-11
  • 1970-01-01
  • 1970-01-01
  • 2021-11-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多