Hugging Face Blog·· 2024-10-29精选AI 评分78
Universal Assisted Generation:跨模型加速推理方法
Universal Assisted Generation: Faster Decoding with Any Assistant Model
AI 导读
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由
原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
来源:Hugging Face Blog · huggingface.co