【问题标题】:data compression - machine learning for exponential distribution数据压缩——指数分布的机器学习
【发布时间】:2011-06-09 07:11:42
【问题描述】:

是否有任何机器学习算法、预测模型可以帮助我压缩指数分布的数据?我已经使用 golomb 代码对文件进行了编码,这无疑节省了大量空间,但这还不够——我需要压缩。 PAQ8L 压缩得不够。

如果需要,请索取文件。

指数分布 --

{a,b,b,a,a,b,c,c,a,a,b,a,a,b,a,c,b,a,b,d}

【问题讨论】:

  • 哈夫曼编码的变种可能吗?
  • "PAQ8L 压缩得不够。"你的期望是什么?数据的大小是多少,什么样的压缩比才算“够用”?您的期望可能太高,因为“无法达到”。也许您可以尝试 cmix(您需要大量内存):byronknoll.com/cmix.html.

标签: algorithm compression machine-learning information-theory exponential


【解决方案1】:

正如其他帖子中提到的,PAQ* 算法使用上下文混合算法。这意味着,您对数据的了解不仅仅是“指数分布”。 如果只知道数据的指数分布,我认为 Golomb 代码仍然是最优的。

【讨论】:

    【解决方案2】:

    我认为这在理论上是不可能的。 Golomb code 已经是几何分布数据的最佳选择。

    【讨论】:

    • 不正确;谷歌paq8l;它将我感兴趣的哥伦布编码字符串压缩了至少 50%。是的,这绝对是可能的。
    • 正如其他帖子中提到的,PAQ* 算法使用上下文混合算法。这意味着,您对数据的了解不仅仅是“指数分布”。 @user562688
    猜你喜欢
    • 2018-06-10
    • 2021-06-02
    • 2019-08-09
    • 2019-03-06
    • 2017-06-21
    • 2017-05-16
    • 2018-03-09
    • 2017-03-26
    • 2019-08-24
    相关资源
    最近更新 更多