Hugging Face 发布 TRL 与 PEFT 集成,实现消费级显卡微调 20B 大模型
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Hugging Face 发布 Diffusers for Mac 1.1,将扩散模型转换为 Core ML 以利用 Apple Silicon 硬件加速。性能测试显示 M1 Max 使用 GPU 最快,标准 M1 使用 ANE 更快,新版本会自动选择最佳加速器。
推荐理由:官方发布 Swift 原生应用并给出多芯片性能数据,可据此判断端侧生成效率。
Hugging Face Diffusers 正式支持 Stable Diffusion 的 LoRA 微调,训练仅需 11 GB 显存,生成的权重文件仅约 3 MB。该功能支持 Dreambooth 和全量微调,并内置自动记录基础模型元数据以简化推理加载。
推荐理由:Diffusers 原生支持 LoRA 大幅降低显存需求并生成极小权重文件,便于模型分享与复用。
Hugging Face 官方提供 Stable Diffusion Core ML 转换权重,让 Apple Silicon 用户能直接调用并本地运行。支持 v1.4、v1.5 及 v2 系列模型,提供 Python 和 Swift 两种推理方式,并附带自定义模型转换脚本。
推荐理由:Hugging Face 官方提供 Stable Diffusion Core ML 转换权重,让 Apple Silicon 用户能直接调用并本地运行。
Hugging Face 宣布 Optimum Intel 集成 Intel OpenVINO,支持在 Intel 处理器上对 Transformers 模型进行推理与量化。以 ViT 模型为例,量化后模型体积缩小 3.8 倍,推理延迟降低 2.4 倍。
推荐理由:Hugging Face 官方宣布集成 OpenVINO,提供一键量化与推理工具,可显著降低模型体积与延迟。
Hugging Face 发布 MTEB 大规模文本嵌入模型评测基准,涵盖 56 个数据集和 8 个任务,支持 112 种语言。该基准提供排行榜和 Python 库,用户可便捷地对模型进行基准测试并提交结果。
推荐理由:MTEB 提供了涵盖多语言和多任务的文本嵌入模型统一评测框架,方便开发者快速选型。
Hugging Face 发布 Inference Endpoints,允许用户通过几步操作将模型从 Hub 直接部署到 AWS 等云厂商的托管基础设施。服务支持 Public、Protected 和 Private 三种安全模式,其中 Private 模式可通过 AWS PrivateLink 实现 VPC 内网访问,并提供自动扩缩容、监控日志和 API 调用能力。
推荐理由:官方发布托管推理服务,提供从公开到私有VPC的多级安全部署选项,降低生产环境部署门槛。
Hugging Face 发布开源库 Optimum,旨在降低 Transformer 模型在生产环境中的部署难度。该库联合硬件合作伙伴(如 Intel)提供模型量化与加速工具,通过 Neural Compressor 等方案实现高效推理。
推荐理由:Hugging Face 联合 Intel 发布 Optimum 库,提供开箱即用的模型量化与加速方案,降低生产环境部署门槛。
Hugging Face 发布 Accelerate 库,通过极简 API 封装分布式训练脚本添加少量代码即可适配多 GPU、TPU 及混合精度训练。该库自动处理设备放置、数据采样同步及梯度聚合,并提供 CLI 启动器简化配置流程。
推荐理由:通过极简 API 封装分布式训练样板代码,使 PyTorch 原生脚本无缝适配多卡与混合精度。