DeepSeek R1 发布一周年:中国开源 AI 生态的崛起与变革
DeepSeek R1 发布一周年,推动中国 AI 从封闭转向开源生态,降低技术、采用和心理门槛。百度在 Hugging Face 的开源仓库从 2024 年的零个激增至 2025 年的 100 多个,字节跳动和腾讯发布量增长八至九倍,月之暗面 Kimi K2 开源引发关注。
DeepSeek R1 发布一周年,推动中国 AI 从封闭转向开源生态,降低技术、采用和心理门槛。百度在 Hugging Face 的开源仓库从 2024 年的零个激增至 2025 年的 100 多个,字节跳动和腾讯发布量增长八至九倍,月之暗面 Kimi K2 开源引发关注。
微软发布 DIFF Transformer V2,通过差分注意力机制在保持键值头数量不变的前提下倍增查询头,实现与标准 Transformer 相当的解码速度。该版本移除了 DIFF V1 中导致数值不稳定的逐头 RMSNorm 层,有效消除注意力汇聚现象。相比同等查询维度的 Transformer,DIFF V2 在输出投影阶段拥有更少的参数和计算量。
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。
Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。
推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。
Google Research 发布研究证明消费级智能手表可准确估算步速、步长等时空步态指标。该研究基于 246 名参与者的约 70,000 个步行片段,使用搭载时间卷积网络(TCN)的深度学习模型处理 Pixel Watch 的 IMU 数据。结果显示智能手表估算结果与智能手机方法性能相当,多数指标效度(Pearson r >0.80)和信度(ICC >0.80)良好。
Hugging Face 联合社区发布 Open Responses 开源推理标准,基于 OpenAI Responses API 扩展。该标准支持原生 Agent 循环、加密推理及工具调用,旨在统一 Agent 推理接口。
推荐理由:Open Responses 将 OpenAI 的 Responses API 开源并标准化,为 Agent 推理提供统一接口。
Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。
推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。
Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。
推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。
Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。
推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。
伯克利 AI 研究团队提出一种基于互信息的框架,直接评估并优化成像系统。该方法通过分解噪声物理特性,仅需测量数据即可量化系统区分物体的能力。在色彩摄影、射电天文、无透镜成像和显微镜四个领域验证中,信息估计准确预测了下游任务性能,且优化结果匹配最先进端到端方法,同时显著降低内存和算力需求。
TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。
推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。
ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。
推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。
Google Research 2025 年在基础 AI、量子计算及科学发现领域取得多项突破。Gemini 3 成为最准确的大语言模型,在 SimpleQA Verified 等基准测试中表现优异,并引入生成式 UI 功能。Gemma 模型支持 140 多种语言,Willow 芯片通过 Quantum Echoes 算法实现量子优势,加速了科学发现进程。
Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。
推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。
NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。
推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。
Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。
推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。
Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。
推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。
IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。
推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。
Google 发布 Gemini 2.5 Flash Native Audio 模型,提升复杂工作流处理与指令遵循能力,已在 Vertex AI 和 Gemini API 上线。同时推出实时语音翻译功能,保留说话人语调,已在 Google Translate 应用上线。
推荐理由:更新原生音频模型并上线实时语音翻译,提供具体评测指标与应用入口。
Google 联合非洲数据科学社区举办 Data Science for Health Ideathon,利用 MedGemma、TxGemma 和 MedSigLIP 等开源健康 AI 模型解决当地医疗挑战。
llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。
推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型与数据,重点开展思维链监控、社会情感影响及经济系统评估等研究。此举旨在通过更稳健的评估方法,确保前沿 AI 系统的安全与责任。
Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。
Google DeepMind 宣布深化与英国政府的合作,旨在通过提供前沿 AI 工具加速科学发现、教育现代化及国家安全建设。双方将建立首个自动化科学实验室,优先向英国科学家开放 AlphaEvolve 等模型,并探索 Gemini 在教育与公共服务中的规模化应用。
Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。
推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
Hugging Face 发布 swift-huggingface,为 Swift 应用提供完整的 Hugging Face Hub 客户端支持。该库解决了大模型下载中断无法续传、缺乏 Python 共享缓存及认证复杂等痛点,支持断点续传、OAuth 2.0 认证及与 Python 生态兼容的缓存结构。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。
推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。
Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。
推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。
Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。
Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。
推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。
Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。
推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。
AlphaFold 2 五年前解决了蛋白质结构预测难题,其预测数据已收录于 AlphaFold Protein Database 并免费开放。该数据库已被全球 300 多万研究人员使用,相关研究被引用超 3.5 万次,并助力 2024 年诺贝尔化学奖的获得。
Google DeepMind的AlphaFold结合密苏里大学的冷冻电镜技术,成功解析了低密度脂蛋白(LDL)的关键蛋白apoB100的原子级结构。该发现揭示了包裹LDL颗粒的笼状外壳细节,有望为预防和治疗动脉粥样硬化性心血管疾病提供新的药物靶点。
推荐理由:AlphaFold结合冷冻电镜解析了致病蛋白apoB100结构,为心血管药物研发提供了关键结构基础。
本文从注意力机制和 KV 缓存出发,推导了连续批处理技术,旨在通过并行处理多个对话并在完成后进行切换来最大化推理吞吐量。该技术解决了大语言模型在同时服务大量用户时因逐词生成导致的计算开销问题,使响应生成更加高效。
Diffusers 正式支持 FLUX-2 图像生成模型,提供 Flux2Pipeline 和 Flux2Transformer2DModel 等组件。该模型使用 Mistral3 作为文本编码器,可通过 diffusers/FLUX.2-dev-bnb-4bit 仓库加载,支持 4-bit 量化部署。
Tavily 分享了构建深度研究智能体的经验,通过上下文工程将 Token 消耗降低 66%,并在 DeepResearch Bench 上达到 SOTA。文章指出应简化编排逻辑、利用模型工具调用能力的演进,并采用线性上下文管理替代传统的 ReAct 模式。
Google Research 发布基于线性回归的轻量级 AI 模型,预测特定充电桩在指定时间后的可用性概率。该模型通过每小时特征权重量化占用率变化,在 30 至 60 分钟预测窗口内,相比“保持当前状态”基线显著提升了准确率。
Hugging Face 发布 Open ASR Leaderboard 新论文,基于60余模型和11个数据集对比,揭示多语言与长音频场景下的性能权衡与开源进展。
推荐理由:基于60余模型和11个数据集的对比,揭示了多语言与长音频场景下的性能权衡与开源进展。