Google Research·· 2026-03-25精选AI 评分68
Google 发布 TurboQuant:零精度损失的 KV 缓存压缩算法
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google Research 发布 TurboQuant 算法,结合 PolarQuant 和 QJL 技术实现零精度损失的向量量化。该算法将 KV 缓存压缩至少 6 倍,在 Gemma 和 Mistral 模型上实现最高 8 倍推理加速,并显著提升高维向量搜索召回率。
推荐理由
TurboQuant 通过零开销量化将 KV 缓存压缩 6 倍并加速推理,为长上下文场景提供了可迁移的高效压缩方案。
来源:Google Research · research.google