跳到正文
原文
Hugging Face Blog·· 2024-10-29精选AI 评分78

Universal Assisted Generation:跨模型加速推理方法

Universal Assisted Generation: Faster Decoding with Any Assistant Model

AI 导读

Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。

推荐理由

原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。

来源:Hugging Face Blog · huggingface.co