【发布时间】:2013-07-10 14:29:50
【问题描述】:
我有机会为 deflate 压缩预设字典。在我的情况下这是有道理的,因为要压缩的数据相对较小,只有 1kb-3kb,而且我有大量代表性示例。要压缩的数据由任意字节序列组成,因此标记化等不是一个好方法。此外,数据显示出大量重复(在数据示例之间),因此好的字典可能会产生非常好的结果。 问题是如何计算好的字典?有没有计算最优字典的算法(给定样本数据)?
我开始研究前缀树,但不清楚如何在这种情况下使用它们。
最好的问候, 贾雷克
【问题讨论】:
标签: compression gzip zlib deflate jzlib