Hugging Face Blog·· 2022-01-13AI 评分12
Hugging Face Infinity 在 Intel Xeon CPU 上的毫秒级延迟案例研究
Case Study: Millisecond Latency using Hugging Face Infinity and modern CPUs
AI 导读
Hugging Face Infinity 在 Amazon EC2 C6i 实例上实现了 Transformer 模型的毫秒级推理延迟。该方案在 Ice Lake 架构上相比 Cascade Lake 实例延迟和吞吐量提升 34%,相比原生 Transformers 提升 800%。Infinity 提供包含预处理和后处理的端到端优化,支持序列分类等任务。
来源:Hugging Face Blog · huggingface.co