【发布时间】:2019-11-16 16:52:26
【问题描述】:
我想使用我自己的指标对空间数据集进行聚类。数据以数据帧中的(x,y) 值对的形式出现,其中每组对都有一个id。就像在下面的例子中,我有三组点:
import pandas as pd
import numpy as np
df = pd.DataFrame({'id': [1] * 4 + [2] * 5 + [3] * 3,
'x': np.random.random(12),
'y': np.random.random(12)})
df['xy'] = df[['x','y']].apply(lambda row: [row['x'],row['y']], axis = 1)
这是我想使用的距离函数:
from scipy.spatial.distance import directed_hausdorff
def some_distance(u, v):
return max(directed_hausdorff(u, v)[0], directed_hausdorff(v, u)[0])
此函数计算Hausdorff distance,即n 维空间的两个子集u 和v 之间的距离。就我而言,我想使用这个距离函数来聚类真实平面的子集。在上面的数据中,有三个这样的子集(ids 从 1 到 3)所以得到的距离矩阵应该是 3x3。
我对聚类步骤的想法是将sklearn.cluster.AgglomerativeClustering 与预先计算的指标一起使用,而我又想使用sklearn.metrics.pairwise import pairwise_distances 进行计算。
from sklearn.metrics.pairwise import pairwise_distances
def to_np_array(col):
return np.array(list(col.values))
X = df.groupby('id')['xy'].apply(to_np_array).as_matrix()
m = pairwise_distances(X, X, metric=some_distance)
但是,最后一行给了我一个错误:
ValueError: setting an array element with a sequence.
但是,调用some_distance(X[1], X[2]) 可以正常工作。
我的直觉是X 需要采用不同的格式才能使pairwise_distances 工作。关于如何完成这项工作或如何自己计算矩阵以便我可以将其粘贴到sklearn.cluster.AgglomerativeClustering 的任何想法?
错误堆栈是
---------------------------------------------------------------------------
ValueError Traceback (most recent call last)
<ipython-input-3-e34155622595> in <module>
12 def some_distance(u, v):
13 return max(directed_hausdorff(u, v)[0], directed_hausdorff(v, u)[0])
---> 14 m = pairwise_distances(X, X, metric=some_distance)
C:\ProgramData\Anaconda3\lib\site-packages\sklearn\metrics\pairwise.py in pairwise_distances(X, Y, metric, n_jobs, **kwds)
1430 func = partial(distance.cdist, metric=metric, **kwds)
1431
-> 1432 return _parallel_pairwise(X, Y, func, n_jobs, **kwds)
1433
1434
C:\ProgramData\Anaconda3\lib\site-packages\sklearn\metrics\pairwise.py in _parallel_pairwise(X, Y, func, n_jobs, **kwds)
1065
1066 if effective_n_jobs(n_jobs) == 1:
-> 1067 return func(X, Y, **kwds)
1068
1069 # TODO: in some cases, backend='threading' may be appropriate
C:\ProgramData\Anaconda3\lib\site-packages\sklearn\metrics\pairwise.py in _pairwise_callable(X, Y, metric, **kwds)
1079 """Handle the callable case for pairwise_{distances,kernels}
1080 """
-> 1081 X, Y = check_pairwise_arrays(X, Y)
1082
1083 if X is Y:
C:\ProgramData\Anaconda3\lib\site-packages\sklearn\metrics\pairwise.py in check_pairwise_arrays(X, Y, precomputed, dtype)
106 if Y is X or Y is None:
107 X = Y = check_array(X, accept_sparse='csr', dtype=dtype,
--> 108 warn_on_dtype=warn_on_dtype, estimator=estimator)
109 else:
110 X = check_array(X, accept_sparse='csr', dtype=dtype,
C:\ProgramData\Anaconda3\lib\site-packages\sklearn\utils\validation.py in check_array(array, accept_sparse, accept_large_sparse, dtype, order, copy, force_all_finite, ensure_2d, allow_nd, ensure_min_samples, ensure_min_features, warn_on_dtype, estimator)
525 try:
526 warnings.simplefilter('error', ComplexWarning)
--> 527 array = np.asarray(array, dtype=dtype, order=order)
528 except ComplexWarning:
529 raise ValueError("Complex data not supported\n"
C:\ProgramData\Anaconda3\lib\site-packages\numpy\core\numeric.py in asarray(a, dtype, order)
536
537 """
--> 538 return array(a, dtype, copy=False, order=order)
539
540
ValueError: setting an array element with a sequence.
【问题讨论】:
-
该错误是否包含回溯?告诉我们
X。sklearn和您的some_distance可能需要 numpy 数组,或者可以通过像np.asarray(X)这样的简单调用将其制成数组的对象。我不认为它对pandas结构有特殊的了解。 -
谢谢@hpaulj。当我使用
as_matrix()将X更改为numpy.ndarray时,也会发生同样的错误。我已经包含了上面的错误堆栈。我开始怀疑“pairwise_distances”可能无法处理包含比实际空间中的点更复杂的东西的数组(即使你传入了一个距离函数,它会为这些复杂的东西产生距离)。
标签: python pandas numpy scikit-learn