【发布时间】:2013-06-17 00:18:24
【问题描述】:
所以,我有两个财务数据文件,分别是“符号”和“交易量”。在符号中,我有如下字符串:
FOO
BAR
BAZINGA
...
在卷中,我有整数值,例如:
0001387
0000022
0123374
...
这个想法是股票代码将在文件中重复,我需要找到每只股票的总交易量。因此,我观察 foo 的每一行都会将 foo 的总体积增加在体积中观察到的值。问题是这些文件可能很大:很容易有 5 到 1 亿条记录。典型的一天,文件中可能有大约 1K 种不同的符号。
在每个新行的符号上使用 strcmp 将非常低效。我正在考虑使用关联数组 --- 允许字符串键的哈希表库 --- 例如 uthash 或 Glib 的哈希表。
我正在阅读一些关于Judy arrays 的好消息?在这种情况下,许可是否有问题?
对选择高效的哈希表实现有什么想法吗?还有,我到底应该使用哈希表还是完全使用其他东西。
嗯.. 为之前的遗漏道歉:我需要一个纯 C 的解决方案。
谢谢。
【问题讨论】:
标签: c hashtable associative-array