【发布时间】:2012-04-08 13:12:33
【问题描述】:
我正在构建系统来分析有关证券交易价格的大量财务数据。鉴于数据将达到 10 兆兆字节,因此其中的一个大挑战是确定对数据使用哪种存储方法。将有许多对数据的查询,例如取平均值、计算标准偏差以及按价格、时间、数量等多列过滤的总和。联接语句不是必需的,但如果有就好了。
目前,出于评估目的,我正在查看 infobright 社区版、monetdb 和 greenplum 社区版。到目前为止,它们看起来很棒,但对于更高级的功能,其中一些版本不提供其中的一些功能(使用多个服务器、插入/更新语句等)。
对于这种情况,您会使用哪些解决方案,以及与其他替代方案相比,它有哪些优势?具有成本效益是一大优势。如果我必须为数据仓库解决方案付费,我愿意,但我宁愿避免它,如果可能的话,采用开源/社区版本的路线。
【问题讨论】:
-
实际上(部分)总和、平均值、标准差 - 即使经过过滤 - 也不是数据挖掘。它们只是简单的统计数据。
-
数据挖掘是从一组数据中发现新信息。统计数据是帮助这一过程的工具。我不认为这样强调术语是有益的,如果我们争论它,将不会有任何成果。就像我说我不同意您的帖子一样,因为您将统计数据拼错为“统计数据”-不必要地强调技术性。我的目标是使用这个数据库来发现新的信息。此外,数据仓库解决方案的构建考虑了数据挖掘。因此,数据挖掘的概念在这里适用。
-
但是,我同意你的观点,“数据库”可能是这篇文章的更好标签。
标签: database data-warehouse greenplum infobright monetdb