Transformers 原生集成 AutoGPTQ 支持模型量化
Hugging Face 在 Transformers 中原生集成 AutoGPTQ 库,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 或 2-bit 精度。该集成兼容 Nvidia 和 AMD 显卡,4-bit 量化下精度损失极小,推理速度接近 fp16 基线,并支持通过 PEFT 对量化模型进行微调。
推荐理由:原生集成让量化部署更便捷,显著降低显存占用且保持推理速度。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Hugging Face 在 Transformers 中原生集成 AutoGPTQ 库,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 或 2-bit 精度。该集成兼容 Nvidia 和 AMD 显卡,4-bit 量化下精度损失极小,推理速度接近 fp16 基线,并支持通过 PEFT 对量化模型进行微调。
推荐理由:原生集成让量化部署更便捷,显著降低显存占用且保持推理速度。
OpenAI 宣布 GPT-3.5 Turbo 支持微调,开发者现在可以使用自有数据对模型进行定制,以适配其特定的使用场景。
推荐理由:GPT-3.5 Turbo 开放微调能力,开发者可利用自有数据定制模型以适配特定业务场景。
Hugging Face 发布 SafeCoder,一款面向企业的全栈代码助手解决方案,支持在客户自有基础设施上自托管部署。该方案基于 StarCoder 模型,提供从数据准备、微调训练到硬件加速推理的完整容器化流程,确保代码数据不出 VPC,并支持 VMware 等主流云及本地环境。
推荐理由:提供企业级私有化代码助手方案,通过自托管和合规训练解决代码安全与隐私顾虑。
Hugging Face 发布 Swift Transformers 工具链,包含 swift-transformers 库、swift-chat 演示应用及 Core ML 转换工具,支持在 Apple 设备上本地运行 Llama 2 等大语言模型。
推荐理由:Hugging Face 发布 Swift Transformers 工具链,提供从模型转换到本地推理的完整方案,降低端侧部署门槛。
Hugging Face 与 Apple 联合发布 Stable Diffusion XL 的 Core ML 版本,支持在 Mac 端侧运行。引入混合位调色板量化技术,将模型体积从 4.8 GB 压缩至 1.4 GB,同时保持较高生成质量。
推荐理由:提供了混合位调色板量化技术,在显著压缩模型体积的同时保持生成质量,支持在 Mac 端侧高效运行。
Hugging Face 发布 Agents.js,这是一个面向 JavaScript 的库,用于在浏览器或服务器端为 LLM 提供工具访问能力。该库内置多模态工具,支持自定义 LLM 和工具,并允许传入文件作为输入。
推荐理由:Hugging Face 发布面向 JavaScript 的 Agent 库,提供开箱即用的多模态工具与自定义扩展能力。
OpenAI 为 ChatGPT 推出自定义指令功能,允许用户设置偏好,系统将在所有未来对话中自动记住并应用这些设置。
推荐理由:该功能允许用户预设偏好并自动应用于所有对话,有助于减少重复设置并提升交互一致性。
Hugging Face 发布了四个官方 Stable Diffusion 模型的 6-bit palettized 版本,支持在 iPhone、iPad 和 Mac 上更高效地运行。配合更新的 coremltools 和 ml-stable-diffusion 仓库,开发者可轻松转换自定义模型并享受更低的内存占用与更快的推理速度。
推荐理由:提供了6-bit量化模型下载与转换代码,帮助开发者在苹果设备上高效部署图像生成模型。
OpenAI 宣布 API 更新,包括更可控的模型、函数调用功能、更长的上下文窗口以及更低的价格。
推荐理由:官方宣布API更新,涵盖函数调用、更长上下文及降价,开发者可据此评估功能升级与成本优化。
阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
Hugging Face 在 transformers 中整合了 bitsandbytes 的 4-bit 量化与 QLoRA 技术,支持在消费级 GPU 上运行和微调大模型。QLoRA 通过 4-bit NormalFloat 存储和双重量化降低显存占用,使单卡微调 65B 参数模型成为可能。
推荐理由:官方整合了4-bit量化与QLoRA技术,提供了在消费级硬件上运行和微调大模型的完整工具链。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。
推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。
OpenAI 发布 ChatGPT iOS 独立应用,支持对话记录同步、语音输入及最新模型改进。
推荐理由:ChatGPT 推出 iOS 独立应用,同步对话记录并支持语音输入,方便用户移动端使用。
Hugging Face宣布将RWKV架构正式集成至transformers库,该架构结合了RNN的推理效率与Transformer的训练优势。目前提供169M至14B参数的预训练模型及RWKV-4 Raven对话模型,并附带权重转换脚本。
推荐理由:RWKV架构正式集成至Hugging Face transformers库,提供从预训练到Chat微调的多种模型及权重转换工具。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。
推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。
Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。
推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。
ChatGPT 发布插件功能,允许模型访问最新信息、运行计算或使用第三方服务。
推荐理由:ChatGPT 首次支持插件,赋予模型调用第三方服务的能力,标志着向智能体交互的演进。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Hugging Face 发布 Diffusers for Mac 1.1,将扩散模型转换为 Core ML 以利用 Apple Silicon 硬件加速。性能测试显示 M1 Max 使用 GPU 最快,标准 M1 使用 ANE 更快,新版本会自动选择最佳加速器。
推荐理由:官方发布 Swift 原生应用并给出多芯片性能数据,可据此判断端侧生成效率。
Hugging Face 发布 PEFT 库,无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning 等方法。通过仅微调少量参数,可在消费级硬件上高效微调大模型,大幅降低存储与算力成本。
推荐理由:官方发布高效微调库,支持LoRA等技术在消费级硬件上微调大模型,显著降低存储与算力成本。