Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

MultiverseComputingCAI 提出了一种名为 Quantization-Aware Healing(QAH)的模型压缩恢复方法,让一个压缩并量化到 4-bit 的模型,在 9 项基准测试中的 7 项上超越了它未压缩的 bfloat16 原版。这意味着“更小但更强”的模型部署路径第一次有了系统性…








