scipy.cluster.vq 进行的聚类肯定属于后者(相似图像组)的种类。
在scipy.cluster.vq 中实现的唯一聚类算法是K-Means 算法,它通常将输入数据视为 n 维欧几里得空间中的点,并尝试划分该空间,以便可以通过以下方式总结新的传入数据“示例 x 最像质心 y”。质心可以被认为是输入数据的原型示例。矢量量化导致了简洁或压缩的表示,因为我们可以记住一个整数,而不是记住我们看到的每个新图像的所有 100 个像素,它指向新图像最相似的原型示例。
如果您有许多小灰度图像:
>>> import numpy as np
>>> images = np.random.random_sample((100,10,10))
所以,我们有 100 张 10x10 像素的图像。让我们假设它们都已经具有相似的亮度和对比度。 scipy kmeans 实现需要平面向量:
>>> images = images.reshape((100,100))
>>> images.shape
(100,100)
现在,让我们训练 K-Means 算法,以便任何新的输入图像都可以分配到 10 个集群之一:
>>> from scipy.cluster.vq import kmeans, vq
>>> codebook,distortion = kmeans(images,10)
最后,假设我们有五个新图像要分配给十个集群之一:
>>> newimages = np.random.random_samples((5,10,10))
>>> clusters = vq(newimages.reshape((5,100)),codebook)
clusters 将包含五个示例中每个示例的最佳匹配质心的整数索引。
这是一个玩具示例,除非您正在处理的图像中感兴趣的对象都居中,否则不会产生很好的结果。由于感兴趣的对象可能出现在较大图像中的任何位置,因此通常会为较小的图像“块”学习质心,然后将它们与较大的图像进行卷积(在许多不同位置进行比较)以提高平移不变性。