Hugging Face Blog·· 2023-12-05精选AI 评分68
Hugging Face 发布 Optimum-NVIDIA 库,一行代码解锁极速 LLM 推理
Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code
AI 导读
Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。
推荐理由
通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。
来源:Hugging Face Blog · huggingface.co