【问题标题】:Design pattern for ongoing survey anayisis持续调查分析的设计模式
【发布时间】:2010-02-08 17:38:10
【问题描述】:

我每季度都会进行一次持续调查。我们让人们注册(他们提供广泛的人口统计信息)。

然后我们让他们用 5 个可能的值来回答 6 个简短的问题,更差、更差、相同、更好、更好。

当然,随着时间的推移,我们不会有相同的参与者,有些人会退出,有些新人会注册,所以我正在尝试决定如何最好地构建数据库和代码(希望使用 Python, Numpy?)以最好地允许按初始人口统计数据定义的各种类别进行持续收集和分析。截至目前,我们有 700 名左右的参与者,所以数据集不是太大。 IE。; 人口统计、UID、北、南、住宅。商业 然后回答 Q1 的 6 个问题 第二季度也是如此,然后需要能够根据各种人口统计数据对季度答案的值进行切分和平均,以查看随时间推移的趋势。

由于每个季度都有不同的参与者,因此平均、分组等有点复杂

任何指向此类数据库设计模式的指针?和分析?这是一个稀疏矩阵吗?

【问题讨论】:

  • 您可能更多地关注架构模式,而不是针对此问题的设计模式。

标签: python design-patterns statistics matrix survey


【解决方案1】:

关于您问题的调查分析部分,我强烈建议您查看R 中的the survey package(其中包括许多有用的小插曲,包括"A survey analysis example")。您可以在网页"survey analysis in R" 上详细了解它。特别是,您可能希望查看标题为 database-backed survey objects 的页面,该页面涵盖了处理非常大的调查数据的主题。

您可以根据需要将此分析集成到 Python with RPy2

【讨论】:

  • 这听起来很有趣一直在看R可能需要潜入它!链接看起来很有帮助!
【解决方案2】:

这是一个数据仓库。虽小,但却是一个数据仓库。

您有一个星型架构

你有事实:

  • 响应值是衡量标准

你有维度:

  • 时间段。这有许多属性(年、季度、月、日、周等)。此维度允许您累积对调查的无限回复。

  • 问题。这有一些属性。通常,您的问题属于类别或产品线或焦点或其他任何内容。您可以在此维度中有很多问题“类别”列。

  • 参与者。每个参与者都有独特的属性和对人口统计类别的引用。您的人口统计类别可以非常简单地列举您的人口统计组合。通过此维度,您可以随时关注受访者或其人口统计类别。

但是 Ralph Kimball 的 The Data Warehouse Toolkit 并遵循这些设计模式。 http://www.amazon.com/Data-Warehouse-Toolkit-Complete-Dimensional/dp/0471200247
买书。在开始走错路之前,完全理解这一切是绝对必要的。

另外,因为您正在做数据仓库。查看 Stack Overflow 上的所有 [数据仓库] 问题。阅读您可以找到的每个数据仓库博客。

只有一种相关的设计模式——星型模式。如果你明白这一点,你就明白了一切。

【讨论】:

  • 这个答案开始解决问题。我不熟悉拉尔夫·金布拉尔?最后一个要点是我一直坚持的,试图弄清楚如何构建数据/表格以最简单的处理?
  • 感谢您的指点,但是我的阅读承诺有点过头了,我知道我的问题很简单,所以我想我会访问博客,我会把这本书放在以后要注意了,,,我会检查对 Star Schema 的引用
  • @dartdog:你的问题不简单。从长远来看,急于找到一个糟糕的解决方案将是您时间的一项糟糕投资。
  • 嘿,我同意这就是我问的原因!但我不想阅读整个主题,因为这是一个相当简单的调查!
  • @dartdog。 (1) 我给了你整个设计。 (2) 如果你不明白,你应该阅读关于该主题的something。剩下的就是我给你写代码了,这似乎不合适。 (3) 这不是“相当简单”。这是一件严肃的事情。
【解决方案3】:

在分析中,如果您的六个问题的提出方式让您相信答案是相关的,请考虑首先对原始分数进行因子分析。通常比较跨地区或客户类型的因素比单独跨问题比较具有更大的统计能力。此外,因子得分更可能呈正态分布(它们是 6 个观察值的加权和),而单独的六个问题则不会。这允许您在比较因子得分时基于正态分布应用 t 检验。

不过,请注意。如果您为答案分配数值 - 1 = 更差,2 = 更差,等等。您暗示更差和更差之间的距离与更差和相同之间的距离相同。这通常是不正确的——你可能真的必须搞砸才能获得“更糟糕”的投票,而只是被动搞砸可能会让你得到“更糟糕”的分数。因此,将基数(数字)分配给序数(排序)有其自身的偏差。

每个季度的参与者数量不相等不是问题 - 存在处理不相等样本量的统计 t 检验。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-05-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-08-31
    相关资源
    最近更新 更多