Google 发布 Gemini 3.1 Flash-Lite 模型
Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。
推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。
推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。
推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的得分,推理性能是 3 Pro 的两倍以上。该模型已在 Gemini API、Vertex AI、Gemini CLI、Android Studio 及 NotebookLM 等平台开放预览。
推荐理由:ARC-AGI-2得分翻倍体现推理能力跃升,覆盖开发者与企业场景,可据此评估复杂任务处理潜力。
Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。
推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。
Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。
推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。
Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。
推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。
Google宣布与Included Health合作,在获得IRB批准后启动全美随机对照试验,评估对话式AI在真实虚拟护理工作流中的表现。该研究基于AMIE、PHA等前期基础,旨在通过大规模真实患者数据验证AI的安全性与有效性。
推荐理由:Google联合Included Health启动全美随机对照试验,标志着医疗AI从实验室模拟走向真实世界的大规模临床验证。
Google DeepMind 面向美国 Google AI Ultra 订阅用户发布 Project Genie 实验原型,基于 Genie 3 模型提供世界创建、实时探索与混剪功能。该原型支持文本与图像提示词生成动态环境,并允许下载探索视频,目前存在生成时长与物理一致性等已知限制。
推荐理由:原文给出了世界模型在实时生成与交互上的能力边界,读者可据此评估其在创意探索中的实际可用性。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。
推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。
Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。
推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。
Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。
推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。
Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。
推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。
Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。
推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。
Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。
推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。
Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。
推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。
Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。
推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。
Google 发布 Gemini 2.5 Flash Native Audio 模型,提升复杂工作流处理与指令遵循能力,已在 Vertex AI 和 Gemini API 上线。同时推出实时语音翻译功能,保留说话人语调,已在 Google Translate 应用上线。
推荐理由:更新原生音频模型并上线实时语音翻译,提供具体评测指标与应用入口。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Google DeepMind的AlphaFold结合密苏里大学的冷冻电镜技术,成功解析了低密度脂蛋白(LDL)的关键蛋白apoB100的原子级结构。该发现揭示了包裹LDL颗粒的笼状外壳细节,有望为预防和治疗动脉粥样硬化性心血管疾病提供新的药物靶点。
推荐理由:AlphaFold结合冷冻电镜解析了致病蛋白apoB100结构,为心血管药物研发提供了关键结构基础。