假设您有以下示例:
n = 4;
rng(0)
A = rand(n,n);
B = A * A';
如果矩阵B 是满秩的,你不能用更少的维度完全覆盖原始矩阵。所以,你只能近似。这里的关键思想是最小化重建误差。
您可以使用eigenvalue decomposition 将B 分解为其特征向量。您可以在 MATLAB 中使用eig,但之后需要对特征值和对应的特征向量进行排序。相反,我更喜欢 Singular Value Decomposition 并在 MATLAB 中使用 svd。请注意,SVD 给出了低秩矩阵逼近中重构误差的最优解。
[U,S,~] = svd(B);
U = U * sqrt(S);
我们现在知道B = U * U'。见 SVD 与特征值分解的关系here。
正如我所说,我们需要对其进行近似。我选择覆盖总方差 99% 的维度如下:
coverage = cumsum(diag(S.^2));
coverage = coverage ./ norm(S,'fro')^2;
[~, nEig] = max(coverage > 0.99);
U2 = U(:,1:nEig);
在这种情况下,U2 有 2 列而不是 4 列。如果数据是相关的,那么收益会更少。结果如下:
B
B1 = U*U'
B2 = U2*U2'
B =
2.8966 2.1881 1.1965 2.1551
2.1881 1.9966 0.6827 1.8861
1.1965 0.6827 0.7590 0.5348
2.1551 1.8861 0.5348 2.0955
B1 =
2.8966 2.1881 1.1965 2.1551
2.1881 1.9966 0.6827 1.8861
1.1965 0.6827 0.7590 0.5348
2.1551 1.8861 0.5348 2.0955
B2 =
2.8896 2.2134 1.1966 2.1385
2.2134 1.9018 0.6836 1.9495
1.1966 0.6836 0.7586 0.5339
2.1385 1.9495 0.5339 2.0528
这似乎是一个很好的近似值。