【发布时间】:2015-08-04 14:54:18
【问题描述】:
我的输入文件是 ijv/coo/triplet 格式,带有字符串列名,例如:
Apple,Google,1
Apple,Banana,5
Microsoft,Orange,2
应该产生这个 2x3 矩阵:
[[1,5,0], [0,0,2]]
我可以通过将列名放入字典并创建一个 scipy 稀疏 coo_matrix 并将该字典映射到 ID 来手动读取它。最后我想在 scipy sparse 或 pandas 数据框中得到它。
有没有更多的pythonic方式来做到这一点? Pandas 只能读取 csv,有scipy.io,但它们也没有 coo 格式。因此,如果没有库,将它放入scipy.coo_matrix 或pandas.DataFrame 的最pythonic 方式是什么?
【问题讨论】:
-
一个 coo 矩阵应该有对应于坐标的列/行。你的坐标是多少?例如, (Apple,Google ) 是否对应一些值为 1 的 x,y ?
-
"(Apple,Google) 是否对应一些值为 1 的 x,y" 是的。
标签: python pandas scipy scikit-learn