跳到正文
原文
Hugging Face Blog·· 2026-08-10精选AI 评分70

Multiverse Computing 提出高效知识蒸馏方法,显存需求降低15倍

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Multiverse Computing 发布论文与开源代码,提出离线 Top-K Logits 缓存与融合分块 KL 损失,将知识蒸馏显存峰值降低15.6倍,使32K上下文蒸馏可在单张 H200 上运行。

推荐理由

通过离线缓存和分块计算将知识蒸馏显存需求降低15倍,使长上下文蒸馏可在单卡运行。

来源:Hugging Face Blog · huggingface.co