跳到正文
原文
Hugging Face Blog·· 2025-01-16精选AI 评分70

TGI 引入多后端支持,统一 vLLM 与 TensorRT-LLM 部署

Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference

AI 导读

Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。

推荐理由

原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。

来源:Hugging Face Blog · huggingface.co