【发布时间】:2016-01-03 16:42:21
【问题描述】:
我想从大量的调查数据中找到规律并提取有用的信息。数据在 .xlsx 电子表格中排序,其中 4 列对应于特定问题,每一行都填写了受访者的文本回复。
如何使用 python 和 openpyxl 从数据中提取模式,例如单词或短语的频率、四个问题的答案之间的联系,或者我应该寻找的其他任何东西?
我在数据/文本挖掘方面的经验有限,所以如果有一些文档、有用的教程或我应该查看的其他 StackOverflow 问题,请告诉我。我在这里和其他地方进行了大量搜索,但没有找到我要找的东西。
到目前为止,我已经根据调查问题对词频进行了拍摄,但事实证明很难浏览 openpyxl 文档来执行此类操作。有没有简单的方法在 python 中做到这一点?
样本数组 [600x4]:
[['this is an example of an answer to question 1 by respondent 1', 'answer to Q2 by R1', 'ans to Q3 by R1', 'ans to Q4 by R1']
['ans to Q1 by R2', 'ans to Q2 by R2', 'ans to Q3 by R2', 'ans to Q4 by R2']
[etc, etc, etc, etc...]]
【问题讨论】:
-
您可以尝试将文件保存为 csv,然后使用 csv 包进行处理。与直接使用 excel 文件相比,我对这条管道的运气要好得多。
标签: python excel data-mining openpyxl text-analysis