跳到正文

#Google

今日 5 条
9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球天气 AI 模型,支持每小时更新、最高 5 公里分辨率,并引入实时卫星数据。该模型在降水预测上取得突破,准确率较前代大幅提升,已集成至 Google Search、Gemini、Google Maps 等平台,并向开发者开放数据接口。

    推荐理由:引入实时卫星数据与小时级更新,显著提升降水预测精度并开放给开发者使用。

  2. Google DeepMind78

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 自主漏洞修复能力

    Google DeepMind 推出 Fairwind 计划,向政府和可信合作伙伴开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,实现自主发现并修复代码漏洞。该方案旨在以较低成本在安全云环境中生成可部署补丁,缩短从漏洞检测到修复的时间。

    推荐理由:结合 Gemini 3.8 Flash Cyber 与 CodeMender 提供自主漏洞修复能力,为政企客户提供了规模化防御的可选方案。

  3. Google DeepMind87

    Google DeepMind 发布 Gemini 3.8 Flash 及网络安全版

    Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。

    推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。

9月2日周三
  1. Google Research70

    Google与NASA合作发布基于深度学习的全球甲烷排放卫星检测框架

    Google Research与NASA JPL合作在PNAS发表论文,提出MAPL-EMIT深度学习框架,利用Swin-S视觉Transformer和360万合成数据,实现了对EMIT卫星数据中甲烷羽流的高精度检测与源定位。该模型在专家标注数据上召回率达84%,并开源了全球羽流数据库、训练模型及推理库。

    推荐理由:论文提出结合物理模拟与视觉Transformer的深度学习框架,显著提升了卫星遥感甲烷排放检测的精度与灵敏度。

  2. Google DeepMind82

    Gemini 推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能。该功能通过动态搜索和扫描视频片段,将长视频分析的 token 消耗降低高达 88%,成本降低 66%,准确率提升 7%。

    推荐理由:Gemini 3.7 Flash 等模型新增智能体视频理解功能,通过动态检索显著降低视频分析成本并提升准确率。

8月28日周五
8月27日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,提供实时流式(gemini-3.5-transcribe-live)与离线处理(gemini-3.5-transcribe)双 API。该模型支持函数调用、自定义词汇及 85 种语言,流式与非流式 WER 分别达 4.0% 和 2.6%,已集成至 Gemini 应用、Gboard 及 Chrome 等产品。

    推荐理由:模型提供实时与离线双API,WER显著降低并支持函数调用,开发者可据此构建高精度语音交互应用。

8月22日周六
8月21日周五
  1. Google Research42

    Google Research 提出 ME-POIs 框架,通过融合移动数据增强语言模型对地点的理解

    Google Research 提出 ME-POIs 框架,将匿名移动模式与文本描述融合以增强语言模型对地点的理解。该框架通过自监督方法构建数值向量,使模型能捕捉地点的动态功能节奏。集成该框架后,模型在预测访问意图、价格水平分类和繁忙度估算上分别获得最高 81.9%、75.1% 和 24.7% 的相对提升。

8月17日周一
  1. Google Research70

    Google Research 提出 PhotoScan 利用智能手机图像估算体成分与代谢风险

    Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。

    推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。

8月14日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.7 Flash 模型

    Google DeepMind 发布 Gemini 3.7 Flash,在编码、智能体和复杂文档处理任务上显著优于 3.6 Flash,并提供半价定价。该模型已用于 Gemini Spark,并更新了 CBRN 和网络安全方面的安全护栏。

    推荐理由:在编码和智能体任务上性能显著提升,并提供半价定价,有助于开发者低成本扩展生产级应用。

8月13日周四
  1. Microsoft Research42

    MindTopo 揭示多模态大模型的空间推理能力

    Microsoft Research 发布 MindTopo 基准测试,评估多模态大模型在拓扑推理与规划中的表现。测试涵盖连通性、包围等五类拓扑属性,结果显示当前模型在静态识别上表现尚可,但在交互规划中常因无法维持结构关系而失败。该基准旨在揭示 AI 在机器人等交互环境中理解拓扑结构的差距。

8月12日周三
  1. Google DeepMind85

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。

    推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。

  2. Google Research68

    Google Research:检索是参数化事实性的瓶颈

    Google Research 发布研究,提出知识画像框架并构建 WikiProfile 基准,评估发现前沿模型如 Gemini-3 和 GPT-5 的事实编码已近饱和,但直接检索失败率仍达 26–34%。研究指出长尾事实与反向问题主要面临检索困难,链式推理能恢复约 40–65% 的已编码知识,表明提升事实性的关键在于优化知识利用。

    推荐理由:研究指出前沿模型事实错误主因是检索瓶颈而非知识缺失,链式推理可恢复大量已编码知识。

  3. Google Research88

    Google 发布 AMIE 实时视频问诊研究:达到专家级临床诊断水平

    Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。

    推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 系列气象预测模型

    Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。

    推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。

7月31日周五
  1. Google Research76

    Google Research发布Science One Framework:基于Chain-of-Evidence的可验证自主科研框架

    Google Research发布Science One Framework及Chain-of-Evidence (CoE) 框架,旨在解决AI自主科研中的可验证性问题。该框架通过构建完整的证据链,实现了零虚假引用和完全可复现的实验分数,同时在MLE-Bench和Parameter-Golf等前沿基准上达到SOTA性能。

    推荐理由:提出Chain-of-Evidence框架与CoE Audit,通过强制证据链解决AI科研幻觉,在保持前沿性能的同时实现零虚假引用。

7月30日周四
  1. Google DeepMind83

    Gemini Robotics ER 2 发布,升级视频理解与多机协作

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机协作能力。模型通过 Gemini Live API 提供低延迟流式推理,支持进度分类与关键帧定位,开发者可通过 Gemini API 接入。

    推荐理由:模型升级视频理解与多机协作能力,提供 Gemini API 入口,开发者可据此评估物理智能体的任务编排潜力。

7月28日周二
  1. Google DeepMind85

    Google DeepMind 发布 Gemini Robotics 2 智能体模型

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA、ER 和端侧三大模型,赋予机器人全身控制、精细操作与多机协作能力。Gemini Robotics ER 2 已在 Google AI Studio 开放,VLA 模型面向早期合作伙伴。

    推荐理由:原文给出了三大模型的能力边界与开放入口,读者可据此评估其在复杂物理任务中的实际落地价值。

7月17日周五
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Flash Cyber 安全模型

    Google 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速发现、验证和修复漏洞。该模型通过 CodeMender 向政府和受信任合作伙伴有限开放,在内部基准测试中表现优于主版本 Flash 模型。

    推荐理由:模型针对代码安全微调,在内部基准中超越主版本,通过CodeMender限流发布,为安全团队提供低成本高效方案。

7月16日周四
  1. Google DeepMind43

    Google DeepMind 与 Isomorphic Labs 联合发布生物弹性方案

    Google DeepMind 与 Isomorphic Labs 联合发布生物弹性方案,旨在通过 AI 技术提升社会应对未来疫情及生物威胁的韧性。该方案涵盖预防、检测与响应三大领域,包括利用 Gemini 模型进行安全评估、通过 AlphaEvolve 优化病原体监测算法,以及开放 AlphaFold 等最新 AI 系统供受信任的研究者加速疫苗与药物设计。

7月9日周四
  1. Google Research86

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布 SensorFM,一个基于超一万亿分钟无标签多模态传感器数据训练的可穿戴健康基础模型。该模型在心血管、代谢、睡眠等35项健康任务中展现出泛化能力,并支持通过智能体自动构建预测头及作为个人健康智能体的底层支撑。

    推荐理由:基于万亿分钟无标签数据训练通用表示,为可穿戴设备健康分析提供了可扩展的底层方案。

7月8日周三
7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

  2. Google Research65

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集,并上线 Heat Resilience Earth Engine App。该数据集基于 Sentinel-2 与高分辨率卫星影像融合生成,精度达30厘米,旨在帮助城市规划者识别低反射率建筑并实施降温干预。

    推荐理由:原文提供了覆盖50+城市的建筑级屋顶反射率数据集及可视化应用,为城市热岛缓解规划提供了高精度数据支持。

  3. Google DeepMind81

    Google 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。Nano Banana 2 Lite 主打极速低成本图像生成,4 秒出图,价格 0.034 美元/千张,可无缝替代旧版 Nano Banana。

    推荐理由:Nano Banana 2 Lite 提供极速低成本的图像生成,Gemini Omni Flash 开放视频生成与对话编辑,两者结合可构建端到端的多媒体工作流。

6月30日周二
  1. Google Research77

    Google 发布 TabFM 表格数据零样本基础模型

    Google 发布 TabFM,一个专为表格数据设计的零样本基础模型,通过上下文学习消除手动特征工程和超参数调优。该模型在 BigQuery 中原生集成,支持通过 SQL 直接进行回归和分类预测,并在 TabArena 基准测试中表现优异。

    推荐理由:TabFM 将表格预测重构为上下文学习问题,无需微调即可在 BigQuery 中直接运行,大幅简化了传统机器学习工作流。

6月27日周六
6月25日周四
6月23日周二
  1. Hugging Face Blog40

    在 Transformers.js 中实验拟议的跨域存储 API

    拟议的 Cross-Origin Storage API 通过密码学哈希而非 URL 标识文件,旨在解决浏览器中跨域缓存隔离导致的重复下载问题。在 Transformers.js 应用中,不同来源的 Web 应用即使请求相同的模型资源或 Wasm 运行时,也会因 Network Isolation Key 不同而无法共享缓存,造成如 177 MB 的重复存储。

6月17日周三
6月11日周四
  1. Google Research42

    Google Research 提出正则化 f-散度核检验框架以审计机器学习遗忘

    Google Research 提出正则化 f-散度核检验框架,旨在解决大规模模型机器遗忘审计中传统两样本检验统计效力低且计算昂贵的问题。该框架利用 f-散度(如 KL 散度、Hockey-stick 散度)结合核正则化方法,自动选择最佳散度类型以精准定位局部数据偏移。该研究已在 AISTATS 2026 发表,理论上证明了其对假阳性的控制能力及随样本增加假阴性收敛至零的特性。

6月10日周三
  1. Google DeepMind68

    Google DeepMind 发起千万美元多智能体 AI 安全研究资助

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布启动总额最高 1000 万美元的技术研究资助计划,旨在应对多智能体交互带来的系统级安全风险。该计划面向全球研究人员开放,重点支持沙盒测试、智能体网络科学、基础设施强化及监督控制四大方向,申请截止日期为 2026 年 8 月 8 日。

    推荐理由:Google DeepMind联合多家机构发起千万美元资助,聚焦多智能体交互中的涌现风险与系统级安全研究。