【发布时间】:2016-08-06 00:32:24
【问题描述】:
我有一个高维单词-bi-gram 频率矩阵(1100 x 100658,dtype=int)。作为列名,我使用 myPandaDataFrame.columns = word-bi-grams 作为行索引,我使用例如熟练度(高、中、低) myPandaDataFrame.columns.set_index(['PROFICIENCY'], inplace=True, drop=True)
那我在做
from sklearn.decomposition import PCA
x = 500
pcax = PCA(n_components=x)
pcax.fit(myPandaDataFrame)
PCA(copy=True, n_components=x, whiten=False)
existing_2dx = pcax.transform(myPandaDataFrame)
existing_df_2dx = pandas.DataFrame(existing_2dx)
existing_df_2dx.index = myPandaDataFrame.index
existing_df_2dx.columns = ['PC{0}'.format(i) for i in range(x)]
我认为这是错误的第一个问题是我只能设置最多 1100 个组件。那是现有的行数。我对 PCA 很陌生,并尝试了几个例子,但似乎我无法让它适合我的矩阵。 是否有人看到我在哪里做错了,或者有人可以链接到与我的问题类似的教程/示例。我会很高兴:)
致以最诚挚的问候
【问题讨论】:
-
您或许可以在datascience.stackexchange.com获得更多帮助
-
谢谢,我会试试的。
-
任何答案有帮助吗?
标签: python-3.x pandas scikit-learn pca