Hugging Face Blog·· 2026-08-25精选AI 评分80
量化感知愈合:压缩的 4-bit 模型超越全精度原版
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Multiverse Computing 提出量化感知愈合(QAH)方法,将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项上超越其全精度版本。该方法通过从原始模型蒸馏而非恢复后的检查点,解决了结构压缩后的能力下降问题。
推荐理由
提出量化感知愈合方法,使压缩量化后的模型在多项基准上超越全精度版本。
来源:Hugging Face Blog · huggingface.co