Diffusers团队详解开源视频生成模型现状与部署优化实践
Hugging Face Diffusers团队发布文章梳理开源视频生成模型现状,提供HunyuanVideo、CogVideoX等模型在Diffusers中的内存优化基准与微调代码。
推荐理由:文章系统梳理了开源视频模型现状,并提供了Diffusers内存优化与微调的具体代码和基准数据。
Hugging Face Diffusers团队发布文章梳理开源视频生成模型现状,提供HunyuanVideo、CogVideoX等模型在Diffusers中的内存优化基准与微调代码。
推荐理由:文章系统梳理了开源视频模型现状,并提供了Diffusers内存优化与微调的具体代码和基准数据。
Hugging Face 在 smolagents 中新增对视觉语言模型(VLM)的原生支持,允许在智能体管道中直接使用视觉能力。通过提供初始图像输入和基于回调的动态截图机制,开发者可轻松构建如自主网页浏览等视觉智能体。
推荐理由:原生支持视觉模型并给出动态截图回调示例,便于开发者快速构建具备视觉能力的智能体。
OpenAI 发布 Operator System Card,详细阐述了其多层安全防护框架。该文档介绍了针对提示词工程和越狱攻击的模型及产品设计缓解措施,以及隐私与安全保障。此外,还披露了外部红队测试、安全评估及持续完善防护机制的工作进展。
NVIDIA 发布 KVPress 工具包,集成多种 KV Cache 压缩算法,支持在预填充阶段动态压缩缓存。该工具与 transformers 库无缝集成,在 128k 上下文长度下可将显存占用从 45GB 降至 37GB,并将 A100 上的解码速度从 11 tokens/s 提升至 17 tokens/s。
推荐理由:NVIDIA 发布 KVPress 工具包,提供多种 KV Cache 压缩算法,帮助开发者降低长上下文场景下的显存占用并提升推理速度。
Hugging Face 发布 SmolVLM 256M 和 500M 两个新模型,其中 256M 参数版本号称全球最小视觉语言模型。新模型采用更小的 SigLIP 视觉编码器和优化的 Tokenization 技术,支持 Transformers、MLX 和 ONNX 格式,旨在降低端侧和消费级设备的运行成本。
推荐理由:Hugging Face 发布 SmolVLM 256M 和 500M 模型,在保持轻量级的同时提供多模态能力,适合端侧部署。
总部位于德国的全球媒体、服务和教育公司 Bertelsmann 宣布将 OpenAI 的技术整合至其全球多个品牌中。此举旨在利用 OpenAI 的技术力量提升其业务在创意生成与生产力方面的表现。
OpenAI 发布研究探讨如何利用推理时算力提升模型对抗鲁棒性。该研究分析了在推理阶段增加计算资源对模型抵御对抗攻击能力的具体影响。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成至 Hugging Face Hub 的“Deploy this model”按钮中。
OpenAI 及其战略合作伙伴发布 Stargate 基础设施计划,旨在构建 AGI 的基础设施。官方正在面向工业界招募数据中心基础设施领域的合作伙伴,合作范围涵盖电力、土地、建设及设备供应等全链条环节。
推荐理由:OpenAI 联合合作伙伴公开招募数据中心基础设施供应商,涉及电力、土地及建设等环节。
OpenAI 宣布启动 Stargate 项目。该项目旨在建设超大规模人工智能基础设施,以支持前沿 AI 模型的训练与推理需求。
Mistral AI 宣布与法新社(AFP)达成全球合作,Le Chat 将接入 AFP 新闻稿以增强事实准确性。该集成支持法语、英语等六种语言,利用 AFP 每日 2,300 条新闻内容,确保回复基于可靠且最新的资讯。此项功能将在未来几周向所有 Le Chat 用户推出。
Hugging Face 发布 TimmWrapper,将 PyTorch Image Models (timm) 集成至 transformers 生态,支持 Pipeline API、Auto Classes、8bit 量化、Trainer 微调及 torch.compile 加速。
推荐理由:Hugging Face 官方发布 TimmWrapper 实现 timm 与 transformers 生态互通,支持量化、微调与编译加速。
Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。
推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。
OpenAI 与 Axios 合作,扩展其在新闻行业的工作。代表数百家新闻室和内容品牌的出版商正利用 OpenAI 的合作伙伴关系和赠款计划采用 AI 工具,同时 ChatGPT 用户可获取领先可靠出版物的信息。
Hugging Face 发布 sentence-transformers/static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1 两个静态嵌入模型,在 CPU 上比主流模型快 100-400 倍,同时保持 85% 以上的性能。文章公开了基于对比学习和 Matryoshka 表示学习的完整训练策略、数据集选择及代码实现。
推荐理由:Hugging Face 开源了基于静态嵌入的高效模型及完整训练代码,为低延迟和端侧部署提供了可复用的实践方案。
Adebayo Ogunlesi 加入 OpenAI 董事会。
Mistral AI 发布 Codestral 25.01 编码模型,采用新架构和分词器,代码生成与补全速度提升约 2 倍。该模型在 HumanEval、LiveCodeBench 等基准测试中表现优异,支持 256k 上下文窗口,现已通过 IDE 插件及 API 向全球开发者开放。
推荐理由:官方公布详细基准数据,显示其在代码补全和生成速度上超越竞品,开发者可直接通过API或IDE插件体验。
Hugging Face发布博客,从伦理视角系统分析AI智能体的自主性分级与多维价值权衡。文章指出风险随自主性增加而上升,建议不开发全自主智能体,并推荐半自主智能体。
推荐理由:文章从伦理视角系统拆解了AI智能体的自主性分级与多维价值权衡,并明确建议不开发全自主智能体。
Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型及 vdr-2b-v1 英文版,支持无需 OCR 直接检索多语言文档。模型基于 50 万高质量合成样本训练,在 ViDoRe 基准测试中表现优异,支持 Matryoshka 表示学习与二值量化以实现高效检索。
推荐理由:开源多语言视觉文档检索模型及50万样本数据集,支持跨语言检索与高效向量压缩。
Hugging Face基于Open LLM Leaderboard评估的3000多个模型,量化了模型推理阶段的CO₂排放。研究发现,社区微调模型通常比官方基座模型更具碳效率,这主要归因于微调减少了输出冗余和重复模式,从而降低了推理时的计算开销。
Hugging Face 发布 smolagents 库,支持模型通过编写代码来调用工具,简化了智能体开发流程。该库兼容 Hugging Face Hub 及 OpenAI、Anthropic 等外部模型,并展示了开源模型在智能体工作流中具备与顶级闭源模型竞争的能力。
推荐理由:Hugging Face 推出 smolagents 库,通过让模型直接编写代码来调用工具,简化了智能体开发并提升了开源模型表现。
OpenAI 发布文章阐述其结构必须进化,旨在建立一个由营利实体成功支持的更强非营利组织。
Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。
推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。
NVIDIA发布LogitsProcessorZoo,提供模块化组件以直接修改语言模型的Logits分布。
推荐理由:原文详解NVIDIA LogitsProcessorZoo的四个核心处理器,提供代码示例展示如何控制生成长度、强制引用和格式。
OpenAI 发布针对 o1 模型的新对齐策略,直接教授模型安全规范及其推理能力。
推荐理由:原文介绍了o1模型的新对齐策略,读者可据此了解模型安全机制的演进方向。
Artificial Analysis 发布 Big Bench Audio 数据集,评估语音语言模型的推理能力。测试显示 GPT-4o 在语音到语音任务中准确率仅为 66%,远低于文本处理的 92%,传统语音转文本再转语音的流水线方案在推理准确性上目前优于原生语音模型。
推荐理由:首次量化语音推理性能衰减,揭示原生语音模型在复杂推理任务中显著落后于文本处理。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一款基于 Transformer 架构的编码器模型,包含 Base(1.49 亿参数)和 Large(3.95 亿参数)两个版本。
推荐理由:ModernBERT 将上下文窗口扩展至 8192 并大幅提升推理速度,为 RAG 和代码检索提供了更高效的开源替代方案。
IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。
推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。
OpenAI 发布 o1 模型,并推出 Realtime API 改进及新的微调方法等开发者工具。
推荐理由:OpenAI 发布 o1 模型并更新开发者工具,提供模型能力变化与接入入口。
TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。
推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。
在 Google Cloud 的 5代 Xeon C4 实例上,文本嵌入吞吐量比 N2 高 10-24 倍,文本生成高 2.3-3.6 倍。C4 每小时价格约为 N2 的 1.3 倍,在文本嵌入和生成任务中分别保持 7-19 倍和 1.7-2.9 倍的 TCO 优势。
Hugging Face 发布合成数据生成器,用户可通过自然语言描述零代码生成文本分类和对话数据集,并支持使用 AutoTrain 直接微调模型。工具基于 distilabel 和 Hugging Face API,提供网页应用、私有部署及 Apache 2.0 开源代码。
推荐理由:Hugging Face 推出零代码合成数据生成器,打通从自然语言描述到模型微调的完整工作流。
埃隆·马斯克在针对 OpenAI 的最新法律文件中再次试图重构其主张,但这与其自身言行相悖。2017 年,马斯克不仅表达了建立盈利性 OpenAI 的意愿,还实际创建了一家此类公司。
Entalpic 与 Hugging Face 联合发布 LeMaterial 开源项目,旨在通过统一清洗材料数据加速机器学习驱动的材料发现。首期发布的 LeMat-Bulk 数据集整合了 Materials Project、Alexandria 和 OQMD 三大数据库,提供 6.7M 条标准化条目及 7 种材料属性。
OpenAI 宣布视频生成模型 Sora 正式开放使用,用户可通过 sora.com 生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形比例,并允许导入自有素材进行扩展、混剪或从文本生成全新内容。
推荐理由:Sora 正式开放使用,支持生成 1080p 视频,用户可自定义比例并导入素材进行混剪。
Hugging Face 社区发布了面向文本到图像生成的开源偏好数据集,包含 1 万对偏好样本,涵盖多种图像风格与提示词复杂度。数据集采用 Apache 2.0 协议,附带用于数据预处理和后处理的代码,并提供了基于 FLUX.1-dev 模型的 LoRA 微调适配器。
推荐理由:开源了文本到图像生成的偏好数据集及微调代码,为社区提供了可复用的训练素材。
Hugging Face 的 83 款开源模型现可通过 Amazon Bedrock Marketplace 部署,底层由 Amazon SageMaker Jumpstart 管理。
跨学科艺术家 Minne Atairu 探讨了 Sora 如何帮助她实现创作愿景。
电影制作人 Lyndon Barrois 演示如何利用 Sora 作为叙事工具。他通过创作全新的世界,展示了该视频生成模型在讲故事方面的应用潜力。
OpenAI 发布指南,指导产品团队将 AI 整合到工作流中。文章探讨了如何利用 AI 提升产品开发的效率与质量,为团队提供具体的实践建议。