【发布时间】:2019-11-19 06:49:18
【问题描述】:
我有一个包含 16 列和 100,000 行的数据集,我正在尝试为矩阵分解训练做准备。我正在使用以下代码对其进行拆分并将其转换为稀疏矩阵。
X=data.drop([data.columns[0]],axis='columns')
y=data[[1]]
X=lil_matrix(100000,15).astype('float32')
y=np.array(y).astype('float32')
X
但是当我运行它时,我得到了这个错误:
.
当我尝试将其插入训练/测试拆分时,它会给我带来更多错误:
发现样本数量不一致的输入变量:[1, 100000]
【问题讨论】:
-
在 Python 中,每个分配都是独立的。将
lil分配给X会替换之前的data.drop分配。并且您的lil_matrix调用不符合文档。重读docs.scipy.org/doc/scipy/reference/generated/… -
我仍然不明白它对数据 tbh 做了什么。他们没有一个例子,这让人沮丧。当我尝试打印数据时,它说它的 1 个存储元素。如果你明白,你能详细说明吗?谢谢
-
我不知道你在做什么。这段代码的来源是什么,或者至少是它的灵感来源。
data的来源是什么。这是什么? -
基本上只是想将我的数据应用到本教程中。但是当我执行 lil sparse 方法时,它会将其变为 1 个值。没看懂..github.com/juliensimon/dlnotebooks/blob/master/sagemaker/…
-
您没有以同样的方式使用
lil_matrix调用。你甚至检查过我给你的文档链接吗?我看到您可能从该教程中借来的点点滴滴,但没有一致之处。在对底层语言(和模块)了解有限的情况下修改教程可能会令人沮丧。
标签: numpy scipy sparse-matrix amazon-sagemaker matrix-factorization