跳到正文
原文
Hugging Face Blog·· 2025-01-23精选AI 评分78

NVIDIA 发布 KVPress 工具包实现 LLM KV Cache 压缩

Mastering Long Contexts in LLMs with KVPress

AI 导读

NVIDIA 发布 KVPress 工具包,集成多种 KV Cache 压缩算法,支持在预填充阶段动态压缩缓存。该工具与 transformers 库无缝集成,在 128k 上下文长度下可将显存占用从 45GB 降至 37GB,并将 A100 上的解码速度从 11 tokens/s 提升至 17 tokens/s。

推荐理由

NVIDIA 发布 KVPress 工具包,提供多种 KV Cache 压缩算法,帮助开发者降低长上下文场景下的显存占用并提升推理速度。

来源:Hugging Face Blog · huggingface.co