【发布时间】:2015-05-04 18:15:10
【问题描述】:
我有大量文件,每个文件代表一个项目,文件包含标签及其权重,反映这些标签与项目的相关性。 例如
file -> 0001.txt has
skiing-0.789
snow-0.65
winter-0.56
file -> 0002.txt has
drama-0.89
comedy-0.678
action-0.12
我想建立一个如下矩阵:
skiing, snow, winter, drama, comedy, action
0001 0.789, 0.65, 0.56, 0, 0, 0
0002 0, 0, 0, 0.89, 0.678, 0.12
我通过阅读所有文件并生成以下字典来做到这一点:
{0001:[(skiing,0.789),(snow,0.65),(winter,0.56)], 0002:[(drama, 0.89),(comedy, 0.678),(action,0.12)]
如何从上面构建矩阵。我使用TfidfVectorizer() 进行了一些研究,我可以通过将项目列表传递给它来获得计数,但我想要带有权重的矩阵。
【问题讨论】:
标签: python matrix pandas machine-learning scipy