【发布时间】:2018-05-30 15:01:14
【问题描述】:
我很确定这是一个常见的用例,但在谷歌搜索半天后,我必须填写一个问题。
我真的很想要一种算法,我可以在数据语料库上运行以确定字典(作为数据结构),然后使用该字典非常快速有效地压缩新到达的数据,这要归功于该字典。
例如,我会在 10,000 条总计 10MB 的消息上运行它以确定字典数据结构,在各方之间共享此字典,然后在享受非常快速和强大的压缩的同时交换消息。
有类似的东西吗? IBM DB2 does exactly that 但我怀疑他们开源了这种方法。 zlib allows one to pass dictionary,但它是原始字节数组,需要对每条消息进行处理,并且没有生成所述字节数组的方法。
在内存中保存数据结构的想法是避免每个消息处理的任何开销。
Java 实现的奖励积分。
【问题讨论】:
标签: java dictionary data-structures compression