【问题标题】:How to get started with Big Data Analysis [closed]如何开始使用大数据分析 [关闭]
【发布时间】:2011-05-18 09:04:19
【问题描述】:

我是 R 的长期用户,最近开始使用 Python。使用传统的 RDBMS 系统进行数据仓库,使用 R/Python 进行数字运算,我觉得现在有必要亲自动手进行大数据分析。

我想知道如何开始使用大数据处理。 - 如何从 Map/Reduce 和 Hadoop 的使用开始简单

  • 如何利用我在 R 和 Python 方面的技能开始进行大数据分析。以 Python Disco 项目为例。
  • 使用 RHIPE 包并查找玩具数据集和问题区域。
  • 找到正确的信息,让我可以决定是否需要从 RDBMS 类型的数据库迁移到 NoSQL

总而言之,我想知道如何从小处着手,逐步提高我在大数据分析方面的技能和专业知识。

感谢您的建议和建议。 对于此查询的一般性质,我深表歉意,但我希望获得有关此主题的更多观点。

  • 苛刻

【问题讨论】:

标签: python r hadoop bigdata


【解决方案1】:

以 Python Disco 项目为例。

很好。玩那个。

使用 RHIPE 包并查找玩具数据集和问题区域。

很好。也可以玩一下。

不要费力寻找“大”数据集。即使是小型数据集也存在非常有趣的问题。事实上,任何数据集都是一个起点。

我曾经构建了一个小型星型模式来分析一个组织的 6000 万美元预算。源数据在电子表格中,基本上难以理解。因此,我将其卸载到星型模式中,并用 Python 编写了几个分析程序来创建相关数字的简化报告。

找到正确的信息让我决定是否需要从 RDBMS 类型的数据库迁移到 NoSQL

这很容易。

首先,获取一本关于数据仓库的书(例如 Ralph Kimball 的 The Data Warehouse Toolkit)。

其次,仔细研究“星型模式”——尤其是 Kimball 解释的所有变体和特殊情况(深入)

第三,实现以下几点:SQL 用于更新和事务。

在进行“分析”处理(无论大小)时,几乎没有任何形式的更新。 SQL(和相关的规范化)不再那么重要了。

Kimball(以及其他人)的观点是,您的大部分数据仓库不是在 SQL 中,而是在简单的平面文件中。数据集市(用于临时、切片和切块分析)可能位于关系数据库中,以允许使用 SQL 进行简单、灵活的处理。

所以“决定”是微不足道的。如果它是事务性的(“OLTP”),它必须在关系数据库或 OO DB 中。如果它是分析性的(“OLAP”),它不需要 SQL,除了切片分析;甚至可以根据需要从官方文件中加载数据库。

【讨论】:

  • 感谢您的详细解答。真的很有帮助。
  • 我认为首先您应该了解数据处理的可扩展模型。可扩展是指具有隐式同步的并行处理。换句话说 - 分成独立的数据和平处理。如果确实有可能,您可以考虑要利用哪种计算机功能。如果您想使用 50 个以上的 cpu 内核,并拥有超过 3 GB/秒的数据读取率 - 您应该选择像 hadoop 这样的大数据工具。我认为尝试 Amazon EMR 可能是一个很好的选择。
【解决方案2】:

您可以考虑的一件事是 DMelt (http://jwork.org/dmelt/) 数据分析程序。一个值得注意的特点是它有数百个使用 Python 语言的示例和几本书。我使用它的原因是它在我的 Windows 10 上运行(因为它使用 Java VM),而且它具有非常好的 2D/3D 图形,可以导出为矢量图形格式。

【讨论】:

  • 欢迎来到 Stack Overflow!虽然这在理论上可以回答问题,it would be preferable 在此处包含答案的基本部分,并提供链接以供参考。
猜你喜欢
  • 1970-01-01
  • 2012-10-28
  • 2013-11-05
  • 2010-09-07
  • 2011-12-03
  • 2011-02-27
  • 2011-11-06
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多