跳到正文
原文
Google Research·· 2026-03-25精选AI 评分68

Google 发布 TurboQuant:零精度损失的 KV 缓存压缩算法

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google Research 发布 TurboQuant 算法,结合 PolarQuant 和 QJL 技术实现零精度损失的向量量化。该算法将 KV 缓存压缩至少 6 倍,在 Gemma 和 Mistral 模型上实现最高 8 倍推理加速,并显著提升高维向量搜索召回率。

推荐理由

TurboQuant 通过零开销量化将 KV 缓存压缩 6 倍并加速推理,为长上下文场景提供了可迁移的高效压缩方案。

来源:Google Research · research.google