【发布时间】:2011-01-24 12:57:13
【问题描述】:
我们计划实施一个系统,用于将高频市场报价记录到数据库中以供进一步分析。为了简单地了解我们可以在不同的数据库解决方案上获得什么样的存储性能,我创建了一个小应用程序来插入一行基本的刻度信息。在几个不同的数据库上运行相同的代码时,我们得到了一些有趣的结果。
插入的数据很简单,如下:
CREATE TABLE [dbo].[price](
[product_code] [char](15) NULL,
[market_code] [char](10) NULL,
[currency] [nchar](6) NULL,
[timestamp] [datetime] NULL,
[value] [float] NULL,
[price_type] [char](4) NULL
) ON [PRIMARY]
微软 SQL 服务器:
总测试时间:32 秒。每秒 3,099 个价格。
MySQL 服务器:
总测试时间:18 秒。每秒 5,349 个价格。
MongoDB 服务器:
总测试时间:3 秒。每秒 25,555 个价格。
此测试的目的只是为了了解底层系统可以预期的“原始性能”类型。在实际实施解决方案时,我们当然会进行缓冲、批量插入等。
我们只关心插入的速度,因为查询是稍后“离线”完成的。
有人对其他适合的数据库有什么建议吗?今晚晚些时候我也会尝试使用 HDF5 和 MonetDB。它需要具有多客户端访问权限。
感谢您的任何建议!
更新:
抱歉,我在提出问题之前对我的问题进行了重大编辑,似乎我遗漏了服务器版本和硬件的一些细节。所有测试均在运行 Windows 2008 x64 的 12GB RAM 的 8 核服务器上进行。
Microsoft SQL Server 2008 企业版 x64。 MySQL 5.1.44 作为 InnoDB 表运行。 MongoDB 1.2.4 x64
当前的测试是一个简单的循环,将行插入到数据库中,将来自纳斯达克的真实历史数据编译到已导入内存的 CSV 文件中。代码在 C# NET4 x64 中。
MS SQL 和 MySQL 服务器已“调整”到完美的设置,而 MongoDB 只是使用默认设置。 SQL 表设置没有索引,因为 DB 的目的很简单,在传输到主分析系统之前作为一个集结地。
许多建议批量插入,但是这样做的方法很困难,因为我们有多个客户端独立于实时流将单个滴答声推送到数据库中。为了允许这样的方法,我们必须扩展数据库前面的层,超出我们现在有机会测试的范围。但是我认为最终架构必须做一些事情,因为我们从除 MongoDB 之外的所有东西中获得的数字不足以处理所需的输入数量。
更新 2:SSD 驱动器确实非常适合这一点,我们自己也在使用它。然而,最终产品将安装在几个不同的客户处,这些客户都提供自己的熨斗。从 IT 部门获得带有 SSD 的服务器仍然很困难……:(
更新 3:
我尝试了建议的 BulkCopy 方法。与其他循环相同的循环的性能,但首先进入 DataTable,然后 BulkInsert 进入 SQL Server,结果如下:
Microsoft SQL Server(批量):
总测试时间:2 秒。每秒 39401 个价格。
【问题讨论】:
-
您也应该使用缓冲和批量插入进行测试。还要确保使用与真实系统相同的索引和约束,并使用合理填充的 Db 进行测试。
-
还请记住,硬件在这里非常重要,例如一些高端 SSD 驱动器将提供更好的性能,所以看看你在哪里花钱,看看它有多重要。跨度>
-
您是在同一台机器上测试它们吗?你用的是 sql server express edition 吗?
-
当您披露您使用的存储引擎(innoDB、MyIsam 等)时,讨论 mySQL 基准测试更有意义。此外,您没有透露您需要使用哪种密钥。您的行有唯一标识符吗?新行有时会替换旧行吗?你将如何检索数据?如果答案是“始终按顺序”,那么您最终会得到一个非常不同的数据库设置,而不是您需要“按市场代码和时间戳范围”检索。
-
TiTaN,它是 SQL Server 2008 Enterprise x64。
标签: c# mysql sql-server sqlite