Hugging Face Blog·· 2023-11-07AI 评分38
使用 AWS Inferentia2 加速 Llama 2 生成
Make your llama generation time fly with AWS Inferentia2
AI 导读
Hugging Face 介绍利用 optimum-neuron 在 AWS Inferentia2 上部署 Llama 2 大语言模型。通过 Neuron Deep Learning AMI 或 SageMaker 可快速配置环境,将模型编译导出为 Neuron 格式。
来源:Hugging Face Blog · huggingface.co