将 Livebook 笔记本部署为 Hugging Face Spaces 应用
Livebook 笔记本现可直接部署为 Hugging Face Spaces 应用。该集成支持通过 Whisper 模型构建多人语音聊天应用,并实现并发模型服务。用户可借助 Bumblebee 和 tokenizers 等库,在 Spaces 中免费运行交互式代码笔记本。
Livebook 笔记本现可直接部署为 Hugging Face Spaces 应用。该集成支持通过 Whisper 模型构建多人语音聊天应用,并实现并发模型服务。用户可借助 Bumblebee 和 tokenizers 等库,在 Spaces 中免费运行交互式代码笔记本。
Hugging Face 博客介绍了一种结合 OpenVINO NNCF 和 🤗 Optimum 的优化工作流,显著降低了 Stable Diffusion 模型在资源受限 CPU 上的推理延迟。该方案通过量化感知训练(QAT)、知识蒸馏和 Token Merging 技术,实现了 5.1 倍的推理加速和 4 倍的模型体积缩减。
Hugging Face 与微软合作在 Azure Machine Learning Studio 原生集成 Hugging Face Model Catalog,提供数千个热门 Transformers 模型。用户可通过几步操作在 Azure 基础设施上快速部署模型并获取推理 API。该服务今日在 Azure 所有可用区域以公共预览版形式开放。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。
推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。
Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face 发布指南,展示如何使用 🤗 Transformers、TensorFlow 和 TPU 从头训练 RoBERTa 模型。教程涵盖使用 🤗 tokenizers 训练 Unigram 分词器、将 WikiText 数据集转换为 TFRecord 格式并上传至 Google Cloud Storage,以及利用 XLA 兼容性完成端到端训练流程。
Snorkel AI 与 Hugging Face 合作,通过 Snorkel Flow 平台集成 Hugging Face Inference Endpoint 服务,帮助企业更灵活地适配基础模型。
Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。
推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。
在 Intel Sapphire Rapids CPU 上,使用 OpenVINO 将 Stable Diffusion 推理延迟从 32.3 秒降至 16.7 秒,实现 2 倍加速。进一步通过 reshape 固定输入形状,延迟可进一步降至 4.7 秒,带来额外 3.5 倍加速。结合系统级优化,相比上代 Ice Lake CPU 原生推理,整体速度提升近 10 倍。
BLOOMZ 模型在 Habana Gaudi2 加速器上实现了比 Nvidia A100 更快的推理速度。176B 参数模型在 Gaudi2 上比 A100 快 1.42 倍,7B 参数模型快 2.89 倍。初代 Gaudi 在 7B 模型上具备更优的性价比。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Fetch 利用 Hugging Face 和 AWS 构建自有 AI 工具,将开发时间缩短 30%。该方案处理超过 1100 万张收据,处理延迟降低 50%。
我们已将部分机器学习推理模型从 AWS ECS 迁移至 Hugging Face Inference Endpoints,以简化部署流程并降低认知负荷。测试显示,Hugging Face 的 RoBERTa 微调模型在大型实例上的延迟低至 80ms,比 ECS 方案快两倍以上。虽然成本增加了 24% 至 50%,但节省的运维时间远超差价。
本文测试了基于 Intel Sapphire Rapids 架构的服务器在运行 Hugging Face PyTorch Transformers 推理时的性能。
Intel 发布第四代 Xeon CPU Sapphire Rapids,引入 AMX 指令集以加速深度学习矩阵运算。Hugging Face 博客演示了结合 Intel IPEX 和 CCL 库,在 AWS 上利用 r7iz.metal-16xl 裸金属实例集群,无需修改代码即可实现 PyTorch 分布式训练加速。
Habana Gaudi2 在模型训练和推理速度上约为 Nvidia A100 80GB 的两倍。在 BERT 预训练中,Gaudi2 相比初代 Gaudi 提速 3.04 倍,相比 A100 提速 1.89 倍。在 Stable Diffusion 推理中,Gaudi2 延迟比 A100 低 2.84 倍,且支持更大批量处理。
🤗 Transformers 库内置了 Time Series Transformer 模型,用于单变量时间序列的概率预测。该模型采用 Encoder-Decoder 架构,支持通过祖先采样生成预测分布,并能处理缺失值。文章以澳大利亚旅游数据集为例,演示了如何结合 GluonTS 进行数据预处理与模型训练。
Hugging Face 发布机器学习总监洞察系列第四期,收录 Javier Mansilla、Shaun Gittens 等四位总监的行业见解。Mercado Libre 总监 Javier Mansilla 分享了机器学习在电商领域的应用,涵盖欺诈预防、推荐系统及基础设施优化,并指出需关注用户体验与长期技术债务。
Hugging Face 宣布停用 Inference API 的付费层级,推荐用户转向新推出的 Inference Endpoints 以获取企业级推理服务。平台同步升级了 Spaces 的硬件选项,用户只需绑定信用卡即可按需选择硬件运行 ML 演示。所有付费服务及 PRO 订阅费用将于每月月初统一结算并提供合并发票。
Hugging Face 宣布 Optimum Intel 集成 Intel OpenVINO,支持在 Intel 处理器上对 Transformers 模型进行推理与量化。以 ViT 模型为例,量化后模型体积缩小 3.8 倍,推理延迟降低 2.4 倍。
推荐理由:Hugging Face 官方宣布集成 OpenVINO,提供一键量化与推理工具,可显著降低模型体积与延迟。
Hugging Face 发布 Inference Endpoints,允许用户通过几步操作将模型从 Hub 直接部署到 AWS 等云厂商的托管基础设施。服务支持 Public、Protected 和 Private 三种安全模式,其中 Private 模式可通过 AWS PrivateLink 实现 VPC 内网访问,并提供自动扩缩容、监控日志和 API 调用能力。
推荐理由:官方发布托管推理服务,提供从公开到私有VPC的多级安全部署选项,降低生产环境部署门槛。