Diffusers团队详解开源视频生成模型现状与部署优化实践
Hugging Face Diffusers团队发布文章梳理开源视频生成模型现状,提供HunyuanVideo、CogVideoX等模型在Diffusers中的内存优化基准与微调代码。
推荐理由:文章系统梳理了开源视频模型现状,并提供了Diffusers内存优化与微调的具体代码和基准数据。
Hugging Face Diffusers团队发布文章梳理开源视频生成模型现状,提供HunyuanVideo、CogVideoX等模型在Diffusers中的内存优化基准与微调代码。
推荐理由:文章系统梳理了开源视频模型现状,并提供了Diffusers内存优化与微调的具体代码和基准数据。
Hugging Face 在 smolagents 中新增对视觉语言模型(VLM)的原生支持,允许在智能体管道中直接使用视觉能力。通过提供初始图像输入和基于回调的动态截图机制,开发者可轻松构建如自主网页浏览等视觉智能体。
推荐理由:原生支持视觉模型并给出动态截图回调示例,便于开发者快速构建具备视觉能力的智能体。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成至 Hugging Face Hub 的“Deploy this model”按钮中。
Mistral AI 宣布与法新社(AFP)达成全球合作,Le Chat 将接入 AFP 新闻稿以增强事实准确性。该集成支持法语、英语等六种语言,利用 AFP 每日 2,300 条新闻内容,确保回复基于可靠且最新的资讯。此项功能将在未来几周向所有 Le Chat 用户推出。
Hugging Face 发布 TimmWrapper,将 PyTorch Image Models (timm) 集成至 transformers 生态,支持 Pipeline API、Auto Classes、8bit 量化、Trainer 微调及 torch.compile 加速。
推荐理由:Hugging Face 官方发布 TimmWrapper 实现 timm 与 transformers 生态互通,支持量化、微调与编译加速。
Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。
推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。
Hugging Face 发布 sentence-transformers/static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1 两个静态嵌入模型,在 CPU 上比主流模型快 100-400 倍,同时保持 85% 以上的性能。文章公开了基于对比学习和 Matryoshka 表示学习的完整训练策略、数据集选择及代码实现。
推荐理由:Hugging Face 开源了基于静态嵌入的高效模型及完整训练代码,为低延迟和端侧部署提供了可复用的实践方案。
Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型及 vdr-2b-v1 英文版,支持无需 OCR 直接检索多语言文档。模型基于 50 万高质量合成样本训练,在 ViDoRe 基准测试中表现优异,支持 Matryoshka 表示学习与二值量化以实现高效检索。
推荐理由:开源多语言视觉文档检索模型及50万样本数据集,支持跨语言检索与高效向量压缩。
Hugging Face 发布 smolagents 库,支持模型通过编写代码来调用工具,简化了智能体开发流程。该库兼容 Hugging Face Hub 及 OpenAI、Anthropic 等外部模型,并展示了开源模型在智能体工作流中具备与顶级闭源模型竞争的能力。
推荐理由:Hugging Face 推出 smolagents 库,通过让模型直接编写代码来调用工具,简化了智能体开发并提升了开源模型表现。
Hugging Face 发布合成数据生成器,用户可通过自然语言描述零代码生成文本分类和对话数据集,并支持使用 AutoTrain 直接微调模型。工具基于 distilabel 和 Hugging Face API,提供网页应用、私有部署及 Apache 2.0 开源代码。
推荐理由:Hugging Face 推出零代码合成数据生成器,打通从自然语言描述到模型微调的完整工作流。
Hugging Face 的 83 款开源模型现可通过 Amazon Bedrock Marketplace 部署,底层由 Amazon SageMaker Jumpstart 管理。
Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。
Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。平台包含 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 和 Qwen 2.5 等模型,结果显示 GPT-4 Turbo 暂居榜首,Qwen 2.5 7B 和 Llama 3.1 8B 等小模型表现优异。
推荐理由:Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。
Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。
推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。
Hugging Face Hub 提供海量存储与流式读取功能,支持 TB 级数据集托管。平台内置 Datasets Viewer 与 SQL Console,支持全文搜索、排序及 DuckDB 语法查询。数据集可无缝对接 Pandas、Polars 等主流库,并提供公开、私有及 Gated 访问控制。
Mistral 在 La Plateforme 推出批量 API,处理高体积请求成本比同步 API 降低 50%。该功能适用于客户反馈分析、文档批量摘要及向量化等场景,单工作区限制 100 万并发请求。
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
PyCharm Professional 推出 Hugging Face 集成,支持在 IDE 内直接插入模型代码并查看 Model Card。该功能允许开发者快速调用如 microsoft/Phi-3.5-vision-instruct 等多模态模型,并管理本地模型缓存。
Argilla 2.4 发布,支持无需代码即可在 Hugging Face Hub 上构建微调与评估数据集。用户可通过 UI 直接导入公开 Hub 数据集,自动建议初始配置并收集人类反馈。该功能旨在降低数据标注门槛, democratize 高质量数据集的创建。
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。
推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。
Hugging Face 发布 Transformers.js v3,引入 WebGPU 支持,推理速度最高提升 100 倍。新增 120 种模型架构,支持 Node.js、Deno 和 Bun 环境,并提供 25 个新示例项目。
推荐理由:引入WebGPU加速与多端运行时支持,为前端和边缘端部署提供可迁移的高性能推理方案。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 安全扫描工具集成至 Hub 扫描套件。所有公开模型仓库在上传文件时将自动接受 Guardian 扫描,以检测 pickle 等序列化格式中的任意代码执行漏洞。
Hugging Face Diffusers 正式支持 Stable Diffusion 3.5 Large,提供 8B 参数模型及少步推理的 Turbo 版本。文章介绍了 QK 归一化与双注意力层等架构变化,并给出了量化推理与 LoRA 微调的实操代码。
推荐理由:文章详细说明了SD3.5 Large的架构变化及Diffusers使用方式,并提供了量化推理与微调的实操指南。
Hugging Face 修复了 Transformers Trainer 在梯度累积时损失计算不匹配的问题,确保数学等价于全批量训练。同时暴露 API 允许用户传入自定义损失函数,并将在后续版本中全面支持。
推荐理由:修复了梯度累积下损失计算偏差,并开放自定义损失函数API,帮助开发者规避训练误差。
Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。
Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。
推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。
Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。
推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。
Hugging Face 推出 Daily Papers 页面,已收录超 3,700 篇论文并拥有超 12k 订阅者。作者可一键认领论文以关联账号,用户可通过评论 @username 与作者实时互动,并在评论区输入 @librarian-bot 获取相关论文推荐。页面支持多语言评论及内置翻译,并集成 arXiv 扩展功能以快速跳转至 Hugging Face 论文页或 Spaces 演示。
Mistral AI 发布 Mistral Small v24.09 模型,下调全线模型 API 价格,并推出 la Plateforme 免费层。le Chat 免费开放 Pixtral 12B 视觉能力,支持任意尺寸图片理解。
推荐理由:官方同步更新模型定价与发布新模型,提供了免费层与Apache 2.0授权,便于评估成本与部署方案。
Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。
推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。
HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。
推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。
Hugging Face 发布 Accelerate 1.0.0 首个候选版,新增 FP8 训练、torch.compile 及多模型 DeepSpeed 支持。该版本稳定了核心 API,并提供了详细的弃用项与迁移指南。
Hugging Face 与 TruffleHog 达成合作,将 TruffleHog 的密钥扫描功能集成至平台。Hugging Face 在自动化扫描管道中引入 TruffleHog 检测密码、Token 和 API 密钥,并在发现已验证密钥时通过邮件通知用户。
Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。
推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。
Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。
推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。
推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。