【发布时间】:2012-05-09 18:49:49
【问题描述】:
我有数千个已根据回复内容标记的调查回复。每个响应可以有一个或多个标签(最多 20 个),并且标签相互独立,而不是被构造成类别-子类别或其他东西。
我希望能够进行如下分析:
- 给定标签有多少个实例?
- 总体上哪些标签出现频率最高?
- 标签 X 出现在哪里,还有哪些其他标签最常出现?
- 所有标签及其旁边的计数的列表
- 选择数据子集进行类似分析(例如按国家/地区)
与我一起工作的人历来都在 Excel 中解决所有问题(一般业务战略咨询工作),但在这种情况下不会奏效。他们的反应是将项目框架更改为 Excel 可以在数据透视表中处理的东西,但如果我们可以使用更强大的工具来支持更复杂的关系,那就更好了。
我一直在学习 SQLite,但开始担心我想做的事情会非常复杂。
我也一直在学习 Python(出于不相关的原因),我有点想知道 ORM 工具和一些 Python 代码是否是更好的选择。
然后是 Access 之类的东西(我没有,但如果它是这类东西的最佳选择,我可能愿意获得)。
总之,我很想知道这些分析总体上会有多难,以及哪些工具最适合这项工作。我完全接受我正在以一种倒退的方式思考部分或全部问题的想法,并且欢迎就我在这里所写内容的任何方面提出任何建议。
【问题讨论】:
-
理想情况下,分析至少会定期进行。
标签: python sql excel ms-access