跳到正文
原文
Hugging Face Blog·· 2024-03-15精选AI 评分68

使用 Optimum Intel 和 fastRAG 在 CPU 上优化 Embedding 模型

CPU Optimized Embeddings with 🤗 Optimum Intel and fastRAG

AI 导读

Hugging Face 发布教程,展示如何利用 Optimum Intel 对 BGE 等 Embedding 模型进行 int8 量化,并在 Intel Xeon CPU 上实现最高 4.5 倍的延迟降低和 4 倍的吞吐量提升。文章提供了集成 fastRAG 框架进行 RAG 检索与重排的具体代码示例。

推荐理由

提供基于 Optimum Intel 量化 BGE 模型的完整代码,展示如何在 Intel CPU 上实现 RAG 检索与重排的低延迟加速。

来源:Hugging Face Blog · huggingface.co