跳到正文

全部动态

今日 5 条
1月20日周二
  1. Hugging Face Blog40

    DIFF Transformer V2 发布

    微软发布 DIFF Transformer V2,通过差分注意力机制在保持键值头数量不变的前提下倍增查询头,实现与标准 Transformer 相当的解码速度。该版本移除了 DIFF V1 中导致数值不稳定的逐头 RMSNorm 层,有效消除注意力汇聚现象。相比同等查询维度的 Transformer,DIFF V2 在输出投影阶段拥有更少的参数和计算量。

  2. Hugging Face Blog88

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。

    推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。

1月16日周五
  1. Google DeepMind68

    Google DeepMind 发布 D4RT 统一4D场景重建与追踪模型

    Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。

    推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。

  2. Google Research50

    Google Research 利用 Pixel Watch 和深度学习模型估算高级步态指标

    Google Research 发布研究证明消费级智能手表可准确估算步速、步长等时空步态指标。该研究基于 246 名参与者的约 70,000 个步行片段,使用搭载时间卷积网络(TCN)的深度学习模型处理 Pixel Watch 的 IMU 数据。结果显示智能手表估算结果与智能手机方法性能相当,多数指标效度(Pearson r >0.80)和信度(ICC >0.80)良好。

1月15日周四
1月14日周三
  1. Google Research75

    Google 发布 MedGemma 1.5 4B 与 MedASR 医疗语音模型

    Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。

    推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。

  2. Google DeepMind72

    Google DeepMind 发布 Veo 3.1 更新:增强参考图生成视频能力并支持原生竖屏与4K

    Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。

    推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。

1月13日周二
  1. Google Research80

    Google发布NeuralGCM降水研究:卫星数据训练提升长期模拟精度

    Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。

    推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。

1月10日周六
  1. Berkeley AI Research35

    基于信息论直接评估与优化成像系统

    伯克利 AI 研究团队提出一种基于互信息的框架,直接评估并优化成像系统。该方法通过分解噪声物理特性,仅需测量数据即可量化系统区分物体的能力。在色彩摄影、射电天文、无透镜成像和显微镜四个领域验证中,信息估计准确预测了下游任务性能,且优化结果匹配最先进端到端方法,同时显著降低内存和算力需求。

1月5日周一
  1. Hugging Face Blog62

    TII 发布 Falcon-H1-Arabic 系列模型

    TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。

    推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。

12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

12月19日周五
12月18日周四
  1. Hugging Face Blog68

    Transformers v5 重构分词器:架构与词表分离,支持从零训练

    Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。

    推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。

12月17日周三
  1. Hugging Face Blog70

    使用 NeMo Evaluator 复现 NVIDIA Nemotron 3 Nano 评测

    NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。

    推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。

  2. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

12月16日周二
  1. Google Research72

    Google 推出 Gemini 论文辅助工具,在 STOC 2026 中验证推理能力

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。

    推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。

  2. Hugging Face Blog72

    开源智能体框架CUGA上线Hugging Face Spaces

    IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。

    推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。

12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog70

    llama.cpp 新增 Router 模式支持多模型动态管理

    llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。

    推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。

  2. Google Research42

    Urania:基于差分隐私的 AI 聊天机器人使用洞察框架

    Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。

12月10日周三
12月9日周二
  1. Mistral AI88

    Mistral 发布 Devstral 2 编码模型及 Vibe CLI 工具

    Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。

    推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。

  2. Google DeepMind68

    Google DeepMind 发布 FACTS Benchmark Suite 评测大模型事实准确性

    Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。

    推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。

12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月4日周四
  1. Hugging Face Blog80

    Hugging Face Skills 让 Claude 等 Agent 完成 LLM 微调全流程

    Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。

    推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。

  2. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

  3. Google Research42

    Google 发布 MSEB 基准测试:评估多模态听觉智能的八大核心能力

    Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。

12月3日周三
  1. Mistral AI88

    Mistral AI 发布 Mistral 3 模型家族

    Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。

    推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face Transformers v5 发布:确立 PyTorch 单后端与模块化设计

    Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。

    推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。

11月26日周三
  1. Google DeepMind40

    AlphaFold:五年影响力回顾

    AlphaFold 2 五年前解决了蛋白质结构预测难题,其预测数据已收录于 AlphaFold Protein Database 并免费开放。该数据库已被全球 300 多万研究人员使用,相关研究被引用超 3.5 万次,并助力 2024 年诺贝尔化学奖的获得。

11月25日周二
  1. Google DeepMind72

    AlphaFold助力解析导致心脏病的LDL关键蛋白apoB100结构

    Google DeepMind的AlphaFold结合密苏里大学的冷冻电镜技术,成功解析了低密度脂蛋白(LDL)的关键蛋白apoB100的原子级结构。该发现揭示了包裹LDL颗粒的笼状外壳细节,有望为预防和治疗动脉粥样硬化性心血管疾病提供新的药物靶点。

    推荐理由:AlphaFold结合冷冻电镜解析了致病蛋白apoB100结构,为心血管药物研发提供了关键结构基础。

  2. Hugging Face Blog35

    Diffusers 支持 FLUX-2

    Diffusers 正式支持 FLUX-2 图像生成模型,提供 Flux2Pipeline 和 Flux2Transformer2DModel 等组件。该模型使用 Mistral3 作为文本编码器,可通过 diffusers/FLUX.2-dev-bnb-4bit 仓库加载,支持 4-bit 量化部署。

11月22日周六
11月21日周五