【发布时间】:2016-06-29 18:54:03
【问题描述】:
我目前在我所在大学的神经科学研究实验室担任本科实习生,在那里我是专门的“编码员/数学专家”。我知道这种描述令人毛骨悚然,但我认为这就是我的看法。
我有许多任务,包括更新遗留代码,这使我退后一步,并尝试将最佳方法概念化。我正在寻找有关构建流程的最佳方式的建议。
目前收集的数据来自两种形式。一种来自基于 3d 的捕获设备,该设备收集不同标记上的数据,最显着的是它们的 xyz 位置,它可以将这些数据导出为 CSV。然而,还有一个用 C 语言编写的奇怪的旧 API,我可以用它来手动获取数据。 还有一个眼动仪,它以专有的二进制格式存储其数据,并提供一个 MEX 文件以在 Matlab 中提取相关信息,但是编译后的 MEX 文件似乎完全是黑盒的。
我正在考虑尝试将所有数据存储在关系数据库中,并使用 python 插件获取所需的数据并在某些数据帧中构建以进行分析。我们说的是 100,000 * 10 of 64floating 用于 3d 动作捕捉。
是否值得研究 SQL 和 NOSQL 架构,或者我应该只将 HDF5 或 JSON 中的所有内容存储在结构化目录中?
【问题讨论】:
-
您的问题可能会被关闭,因为它要么太宽泛,要么需要推荐。但是,标准 SQL 数据库和 NOSQL 都可以毫无问题地处理一百万个点。
-
有那么广泛吗?我的意思是它很软,但它不像我要一个教程或任何东西。我知道两者都可以处理大量数据,我更多的是询问采用的最佳结构。
-
我认为这将取决于您希望如何使用/处理您的数据。每天存储 100 万行新行对于这两种方法都不是问题。如果您选择 SQL,我建议您对数据进行分区,以便表保持可维护性。
标签: python mysql sql database pandas