【发布时间】:2012-03-11 23:59:24
【问题描述】:
我正在尝试练习逻辑回归技术来对文本进行分类,并且我想以 p x n 矩阵的形式构建数据集,p 行用于戏剧,n 列用于唯一单词。我已经有一个文本可以处理,我只需要计算其中的单词。
跟踪哪个单词出现在哪个游戏中很重要,因此对于给定的游戏,我已经能够创建一个 Python 字典来记录唯一单词。我不知道该怎么做是将这些字典组合起来,例如
romeo = {[alas,2],[julliet,35]}
caesar = {[et,1],[tu,3],[cassius,12]}
可以合并生成矩阵
alas julliet et tu cassius
romeo 2 35 0 0 0
caesar 0 0 1 3 12
为了清楚起见,我创建了一个示例,其中每个剧本仅由独特的单词组成 - 当然,实际上这根本不是真的。
有人如何从这些字典中构建这个矩阵?从其他地方开始会更容易吗?
【问题讨论】:
-
您希望得到的矩阵采用什么格式? Python 本身没有原生的二维数组数据类型。
标签: python arrays text dictionary categorization