跳到正文
原文
Hugging Face Blog·· 2022-03-16AI 评分38

使用 Hugging Face Transformers 和 AWS Inferentia 加速 BERT 推理

Accelerate BERT inference with Hugging Face Transformers and AWS Inferentia

AI 导读

AWS Inferentia 通过定制芯片提供最高 2.3 倍吞吐量和 80% 更低推理成本。Hugging Face 发布端到端教程,演示如何结合 Amazon SageMaker 将 BERT 模型转换为 AWS Neuron 格式并部署实时推理端点。该方案支持通过自定义 inference.py 脚本在 Neuron Core 上运行文本分类任务。

来源:Hugging Face Blog · huggingface.co