Hugging Face 2024 安全功能亮点
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。
推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。
推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。
Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。
推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。
Hugging Face 推出 Inference for PROs,为付费用户提供精选模型的专属 API 端点及更高速率限制。该服务支持 Meta Llama 3、Mixtral 8x7B 等模型,利用 text-generation-inference 实现极速推理。PRO 用户可借此便捷地进行原型开发与测试,无需自行部署基础设施。
Hugging Face 发布高效图像生成模型 Würstchen,通过42倍空间压缩实现比 SDXL 更快的推理速度与更低的显存占用。该模型在 Diffusers 库中集成,支持 PyTorch 2.0 SDPA 加速与 torch.compile 优化,并提供多种显存节省策略。
推荐理由:通过42倍极端压缩显著降低训练与推理成本,为资源受限场景提供高效图像生成方案。
Hugging Face 发布 SafeCoder,基于 155 亿参数的 StarCoder 模型提供企业级代码辅助。该方案具备 8192-token 上下文窗口,支持在本地或云端通过 Docker 部署,实现完全的数据隐私与定制化微调。相比 GitHub Copilot 等闭源服务,SafeCoder 提供模型架构、训练数据及详细指标的透明度,并允许企业完全控制基础设施与合规性。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,正式支持适配 Stable Diffusion XL (SDXL) 的 T2I-Adapter。
推荐理由:提供了适配 SDXL 的轻量级控制模型及完整训练推理代码,便于在保持生成质量的同时降低显存与计算开销。
Fetch 利用 Amazon SageMaker 与 Hugging Face 优化机器学习流水线,将最慢扫描的延迟降低 50%。该方案通过 Amazon SageMaker Model Training 和 Processing 提升文档理解模型精度 200%,并借助 Hugging Face AWS Deep Learning Container 简化部署。
Hugging Face Hub 正式登陆 AWS Marketplace,用户现可通过 AWS 账户直接订阅并支付 Hugging Face 服务费用。该集成计费方式涵盖 Inference Endpoints、Spaces Hardware Upgrades 和 AutoTrain 等托管服务,支持组织内成员统一管理账单。
Hugging Face 发布 Swift Transformers 工具链,包含 swift-transformers 库、swift-chat 演示应用及 Core ML 转换工具,支持在 Apple 设备上本地运行 Llama 2 等大语言模型。
推荐理由:Hugging Face 发布 Swift Transformers 工具链,提供从模型转换到本地推理的完整方案,降低端侧部署门槛。
Segmind 开源了 SD-Small 和 SD-Tiny 两个压缩 Stable Diffusion 模型的权重及训练代码。这两个模型基于 Realistic-Vision 4.0 采用知识蒸馏技术训练,参数量分别减少 35% 和 55%,推理速度最高提升 100%。
Hugging Face 与 Apple 联合发布 Stable Diffusion XL 的 Core ML 版本,支持在 Mac 端侧运行。引入混合位调色板量化技术,将模型体积从 4.8 GB 压缩至 1.4 GB,同时保持较高生成质量。
推荐理由:提供了混合位调色板量化技术,在显著压缩模型体积的同时保持生成质量,支持在 Mac 端侧高效运行。
Hugging Face 发布 Agents.js,这是一个面向 JavaScript 的库,用于在浏览器或服务器端为 LLM 提供工具访问能力。该库内置多模态工具,支持自定义 LLM 和工具,并允许传入文件作为输入。
推荐理由:Hugging Face 发布面向 JavaScript 的 Agent 库,提供开箱即用的多模态工具与自定义扩展能力。
🤗 Diffusers 库迎来发布一周年,回顾其在社区支持下拓展的多项核心功能。新增 DeepFloyd IF 和 SDXL 等高分辨率图像生成支持,并引入 VideoFusion 和 Shap-E 实现文本到视频及 3D 模型生成。同时集成 Consistency Models 加速推理,提供 PyTorch 2.0 优化及安全检测组件。
Hugging Face 发布文章梳理开源文本生成与大语言模型生态。Llama 2 在多项基准测试中超越其他开源模型,BLOOM 参数量超 GPT-3,StarCoder 专注代码补全。开源模型助力企业保护数据、降低成本并适配特定领域。
Livebook 笔记本现可直接部署为 Hugging Face Spaces 应用。该集成支持通过 Whisper 模型构建多人语音聊天应用,并实现并发模型服务。用户可借助 Bumblebee 和 tokenizers 等库,在 Spaces 中免费运行交互式代码笔记本。
Hugging Face Hub 面向画廊、图书馆、档案馆和博物馆(GLAM)领域发布应用指南,介绍如何利用该平台共享和访问机器学习模型、数据集及演示应用。平台目前托管超过 19 万个模型、3.3 万个数据集和 10 万个应用,支持通过 API 部署或集成 Transformers 库使用。文章详细演示了如何筛选特定任务与语言的模型,以及如何上传 CSV 格式的数据集。
Hugging Face Hub 新增功能,允许用户通过 DuckDB 对平台上存储的 50,000 多个数据集运行 SQL 查询。Dataset Viewer 会自动将公开数据集转换为 Parquet 文件,用户可通过 HTTP 调用获取文件 URL,并利用 DuckDB 的 httpfs 扩展直接对远程文件执行分析查询。
Hugging Face Hub 上线 Meta AI fastText 官方镜像,托管 157 种语言词向量及语言识别模型。用户可通过 huggingface_hub 库轻松下载模型,并利用内置的文本分类和特征提取小部件进行交互。
阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
Hugging Face 宣布举办首届开源 AI 游戏开发大赛,参赛者需在 7 月 7 日至 9 日期间使用 AI 工具制作游戏。参赛作品需支持网页或 Windows 平台,且必须集成至少一个开源 AI 工具。比赛强调利用 Stable Diffusion 等工具加速开发,面向全球开发者免费开放。
Hugging Face Hub 正式集成 BERTopic,为模型和数据集提供自动主题建模功能。该工具支持对文本数据进行聚类与可视化,帮助开发者快速理解语料库结构。集成后用户可直接在 Hub 上利用该算法进行主题分析。
Hugging Face 与微软合作在 Azure Machine Learning Studio 原生集成 Hugging Face Model Catalog,提供数千个热门 Transformers 模型。用户可通过几步操作在 Azure 基础设施上快速部署模型并获取推理 API。该服务今日在 Azure 所有可用区域以公共预览版形式开放。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。
推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。
推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。
Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。
推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。
Hugging Face 发布首个官方 Spark 支持,允许用户通过 `from_spark` 函数直接将 Apache Spark dataframe 转换为 Hugging Face Dataset。该功能省去了写入 Parquet 文件的繁琐步骤,使 16GB 数据集的处理时间从 22 分钟缩短至 12 分钟,训练和微调速度提升超过 40%。
Hugging Face 推出面向中文用户的官方博客 hf.co/blog/zh,由志愿者翻译博客文章及 Transformer、扩散模型和强化学习课程。此举旨在服务日益增长的中文 AI 社区,促进相互学习与协作。Hugging Face 将加强与 PaddlePaddle 等组织的合作,并继续举办线上课程及线下活动以推动开源机器学习领域的知识共享。
Snorkel AI 与 Hugging Face 合作,通过 Snorkel Flow 平台集成 Hugging Face Inference Endpoint 服务,帮助企业更灵活地适配基础模型。
Hugging Face 发布伦理与社会通讯第 3 期,阐述在开源机器学习中平衡开放性与风险控制的伦理框架。平台推出涵盖严谨、同意、社会意识等 6 个维度的伦理标签,并上线内容举报功能以识别违规模型与数据集。此外,Hugging Face 通过完善模型卡片、推广 RAIL 许可证及社区协作机制,致力于最小化 AI 潜在危害。
BLOOMZ 模型在 Habana Gaudi2 加速器上实现了比 Nvidia A100 更快的推理速度。176B 参数模型在 Gaudi2 上比 A100 快 1.42 倍,7B 参数模型快 2.89 倍。初代 Gaudi 在 7B 模型上具备更优的性价比。
Hugging Face 改进了 Hugging Face Hub 对 Jupyter 笔记本的托管支持,新增渲染功能使 ipynb 文件以人类可读格式展示。Hub 现已支持一键将托管笔记本直接打开在 Google Colab 中。此举旨在提升模型、数据集及演示资源的可复现性与使用便利性。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Kakao Brain 与 Hugging Face 联合发布首个开源 ALIGN 模型及 7 亿图文对 COYO 数据集。该模型在多项任务上表现媲美 Google 原版,且训练数据完全公开,支持零样本图像分类与多模态嵌入提取。
Hugging Face 发布 Diffusers for Mac 1.1,将扩散模型转换为 Core ML 以利用 Apple Silicon 硬件加速。性能测试显示 M1 Max 使用 GPU 最快,标准 M1 使用 ANE 更快,新版本会自动选择最佳加速器。
推荐理由:官方发布 Swift 原生应用并给出多芯片性能数据,可据此判断端侧生成效率。