Perch 2.0 论文:陆地鸟类模型如何迁移至水下声学任务
Google Research 与 DeepMind 联合发布论文,展示主要基于鸟类数据训练的 Perch 2.0 模型在海洋声学任务中表现出色。该模型无需水下音频训练即可生成高质量嵌入向量,配合简单的逻辑回归分类器,能利用少量标注数据快速构建鲸鱼声纹分类器。
Google Research 与 DeepMind 联合发布论文,展示主要基于鸟类数据训练的 Perch 2.0 模型在海洋声学任务中表现出色。该模型无需水下音频训练即可生成高质量嵌入向量,配合简单的逻辑回归分类器,能利用少量标注数据快速构建鲸鱼声纹分类器。
Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。
推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。
Google Research 提出 Natively Adaptive Interfaces (NAI) 框架,利用 Gemini 多模态 AI 能力构建动态智能体,将数字界面从被动工具转变为主动协作伙伴。
Google宣布与Included Health合作,在获得IRB批准后启动全美随机对照试验,评估对话式AI在真实虚拟护理工作流中的表现。该研究基于AMIE、PHA等前期基础,旨在通过大规模真实患者数据验证AI的安全性与有效性。
推荐理由:Google联合Included Health启动全美随机对照试验,标志着医疗AI从实验室模拟走向真实世界的大规模临床验证。
Google DeepMind 面向美国 Google AI Ultra 订阅用户发布 Project Genie 实验原型,基于 Genie 3 模型提供世界创建、实时探索与混剪功能。该原型支持文本与图像提示词生成动态环境,并允许下载探索视频,目前存在生成时长与物理一致性等已知限制。
推荐理由:原文给出了世界模型在实时生成与交互上的能力边界,读者可据此评估其在创意探索中的实际可用性。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。
推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。
Google Research 发布 ATLAS 多语言模型缩放法则,基于 774 次训练实验量化 1400 对语言间的协同与干扰效应,为多语言模型规模、数据量及语言配比提供数据驱动指导。
Google Research 发布 GIST 算法,通过平衡数据多样性与效用解决大规模数据集采样难题。该算法在 NeurIPS 2025 提出,提供数学保证,确保选出的子集价值至少达到绝对最优解的一半。
Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。
推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。
Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。
推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。
Google Research 发布研究证明消费级智能手表可准确估算步速、步长等时空步态指标。该研究基于 246 名参与者的约 70,000 个步行片段,使用搭载时间卷积网络(TCN)的深度学习模型处理 Pixel Watch 的 IMU 数据。结果显示智能手表估算结果与智能手机方法性能相当,多数指标效度(Pearson r >0.80)和信度(ICC >0.80)良好。
Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。
推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。
Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。
推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。
Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。
推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。
Google Research 2025 年在基础 AI、量子计算及科学发现领域取得多项突破。Gemini 3 成为最准确的大语言模型,在 SimpleQA Verified 等基准测试中表现优异,并引入生成式 UI 功能。Gemma 模型支持 140 多种语言,Willow 芯片通过 Quantum Echoes 算法实现量子优势,加速了科学发现进程。
Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。
推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。
Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。
推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。
Google 发布 Gemini 2.5 Flash Native Audio 模型,提升复杂工作流处理与指令遵循能力,已在 Vertex AI 和 Gemini API 上线。同时推出实时语音翻译功能,保留说话人语调,已在 Google Translate 应用上线。
推荐理由:更新原生音频模型并上线实时语音翻译,提供具体评测指标与应用入口。
Google 联合非洲数据科学社区举办 Data Science for Health Ideathon,利用 MedGemma、TxGemma 和 MedSigLIP 等开源健康 AI 模型解决当地医疗挑战。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型与数据,重点开展思维链监控、社会情感影响及经济系统评估等研究。此举旨在通过更稳健的评估方法,确保前沿 AI 系统的安全与责任。
Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。
Google DeepMind 宣布深化与英国政府的合作,旨在通过提供前沿 AI 工具加速科学发现、教育现代化及国家安全建设。双方将建立首个自动化科学实验室,优先向英国科学家开放 AlphaEvolve 等模型,并探索 Gemini 在教育与公共服务中的规模化应用。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。
AlphaFold 2 五年前解决了蛋白质结构预测难题,其预测数据已收录于 AlphaFold Protein Database 并免费开放。该数据库已被全球 300 多万研究人员使用,相关研究被引用超 3.5 万次,并助力 2024 年诺贝尔化学奖的获得。
Google DeepMind的AlphaFold结合密苏里大学的冷冻电镜技术,成功解析了低密度脂蛋白(LDL)的关键蛋白apoB100的原子级结构。该发现揭示了包裹LDL颗粒的笼状外壳细节,有望为预防和治疗动脉粥样硬化性心血管疾病提供新的药物靶点。
推荐理由:AlphaFold结合冷冻电镜解析了致病蛋白apoB100结构,为心血管药物研发提供了关键结构基础。
Google Research 发布基于线性回归的轻量级 AI 模型,预测特定充电桩在指定时间后的可用性概率。该模型通过每小时特征权重量化占用率变化,在 30 至 60 分钟预测窗口内,相比“保持当前状态”基线显著提升了准确率。
Google DeepMind 发布 Gemini 3 Pro Image(代号 Nano Banana Pro),提供 2K/4K 分辨率、高精度文本渲染及物理控制能力。该模型支持通过 Google Search 进行实时知识检索,并内置 SynthID 数字水印,已在 Google AI Studio 和 Vertex AI 开放预览。
推荐理由:该模型在文本渲染、物理控制和知识检索方面实现升级,开发者可据此构建更精准的多模态应用。
Google 发布端到端实时语音翻译模型,延迟仅2秒并保留原声,已在 Google Meet 和 Pixel 10 部署。该模型基于 AudioLM 和 SpectroStream 架构,支持英、西、德、法、意、葡等语言。
推荐理由:端到端架构将延迟降至2秒并保留原声,已在Google Meet和Pixel 10部署,可据此评估实时语音翻译的技术进展。
Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。
推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。
Google DeepMind 在新加坡设立新研究实验室,加速前沿 AI 在亚太地区的研发与应用。新团队将聚焦 Gemini 核心能力提升及语言文化包容性研究,并与政府、企业及学术界深化合作。此举旨在通过 AlphaFold、SEA-LION 等成果,推动 AI 技术更好地服务亚太地区多样化需求。
Google DeepMind 发布 WeatherNext 2,生成速度提升 8 倍,分辨率达小时级,可预测数百种天气场景。该模型基于 Functional Generative Network 架构,在 99.9% 的变量上超越前代,数据已上线 Earth Engine 和 BigQuery,并升级了 Google Search、Gemini 及 Maps 的天气服务。
推荐理由:模型速度提升8倍且支持小时级分辨率,通过多场景预测增强极端天气研判能力。
Google Research 联合 Google DeepMind 发布 Natural Forests of the World 2020 地图及数据集,利用 MTSViT 模型实现 10 米分辨率天然林识别,准确率达 92.2%。同时发布 Planted 和 ForTy 两个大规模基准数据集,用于支持 EUDR 合规及下一代森林分类模型研发。
推荐理由:发布全球首个10米分辨率天然林地图及基准数据集,为合规与生态监测提供高精度AI基线。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。
推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。
Google Quantum AI 发布名为 Decoded Quantum Interferometry (DQI) 的量子算法,用于解决经典计算机难以处理的优化问题。该算法将优化问题转化为解码问题,在最优多项式交集(OPI)任务中,仅需数百万次量子逻辑操作即可求解,而经典计算机需超过 10^23 次操作。
Google 发布 JAX-Privacy 1.0,提供差分隐私算法和审计工具,支持在 JAX 上高效训练大规模模型。该工具包已用于训练 VaultGemma,并提供基于 Keras 微调 Gemma 模型的示例。
推荐理由:官方发布支持大规模并行的差分隐私工具包,提供微调示例,降低隐私保护机器学习门槛。
北爱尔兰 C2k 项目的 100 名教师通过整合 Gemini 和 Google Workspace 工具,每周平均节省 10 小时工作时间。试点项目捕获了 600 多个 Gemini 独特用例,涵盖行政工作简化、爱尔兰语课程创建及个性化学习支持。C2k 计划将 Gemini 培训推广至更多教师,以深化 AI 在教育中的负责任应用。
Google Research 提出 Nested Learning 新范式,将模型架构与优化算法统一为多层级优化问题,以解决持续学习中的灾难性遗忘。基于该范式设计的 Hope 架构在语言建模中表现优异,并展现出比现有 SOTA 模型更好的长上下文记忆管理能力。
Google Research 发布 DS-STAR,这是一款能自动处理多样化异构数据并生成可执行代码的数据科学智能体。该框架通过数据文件分析、LLM 验证和顺序规划机制,在 DABStep、KramaBench 和 DA-Code 基准测试中均取得最先进性能。DS-STAR 在 DABStep 上的准确率从 41.0% 提升至 45.2%,并在该基准的公共排行榜上排名第一。