跳到正文

#Google

今日 1 条
今天10月9日周五
  1. AWS Machine Learning Blog70

    AWS 发布 AgentCore payments 支持 AI 智能体按次付费

    AWS 发布 Amazon Bedrock AgentCore payments,支持 x402 协议实现 AI 智能体按次付费。该功能提供托管钱包、基础设施层支出限制及链上审计,BlockRun 与 Incarna 已将其用于 Base 网络上的 USDC 结算。

    推荐理由:AWS 发布 AgentCore payments 支持 x402 协议,提供托管钱包与基础设施层支出限制,解决 Agent 高频小额支付难题。

10月8日周四
  1. Google Research75

    Google Research:AI辅助是否侵蚀初级专业人员的专业判断力

    Google Research 与 NBER 联合发布实地实验,对133名专利律师进行为期三个月的测试。结果显示,AI工具使初级律师的短期产出提升,但在移除AI后,其独立纠错能力未获提升,反而出现低分增多现象;资深律师则通过AI强化了专业判断。

    推荐理由:基于专利律师的三个月实地实验,揭示AI在提升初级人员短期产出的同时可能阻碍其长期专业判断力的形成。

10月7日周三
  1. AWS Machine Learning Blog12

    Qlik 如何利用 Amazon Bedrock 构建企业级可信 AI

    Qlik 利用 Amazon Bedrock 构建 Qlik Answers,解决企业员工获取可信数据答案的需求。该系统通过分层架构实现精准路由,结合 Amazon OpenSearch Service 检索与 Guardrails 安全过滤,确保回答有据可查。自 2026 年 2 月全面上线以来,其 Discovery Agent 已为客户发现超 10 万次异常,显著提升了企业运营效率。

10月6日周二
  1. Google Research73

    Google 发布地球AI人口动态基础模型PDFM

    Google Research 发布地球AI人口动态基础模型PDFM,将搜索趋势、环境等隐私数据压缩为位置嵌入。该模型在麻疹疫苗、心血管疾病、登革热、产后抑郁和霍乱预测中验证了提升效果,并作为Population Dynamics Insights在Google Maps Platform开放预览。

    推荐理由:原文展示了PDFM在五大公共卫生场景的实测增益,读者可评估其作为现成地理空间特征提升现有模型的效果。

10月2日周五
  1. Google Research61

    Google 发布基于可信执行环境的下一代联邦学习系统

    Google 发布基于可信执行环境(TEE)的下一代联邦学习系统,通过公开透明日志和可重现构建实现可验证的隐私保障。Gboard 已部署该系统,在获得更强隐私保护和更高精度的同时,显著缩短了模型训练时间。

    推荐理由:Google 发布基于 TEE 的联邦学习系统,提供可验证隐私保障,Gboard 已部署并实现训练加速。

10月1日周四
  1. Google DeepMind90

    Google 发布 Gemini 4 Argon 模型,输出上限扩至 100 万 token

    Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。

    推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。

9月30日周三
  1. Google DeepMind75

    Google DeepMind 发布 SynthID Bio 用于蛋白质水印

    Google DeepMind 发布 SynthID Bio,将数字水印技术延伸至合成生物学领域,在保留蛋白质生物功能的同时实现物理层面的可验证性。该方法通过微调 AlphaFold 3 扩散网络,使预测的 3D 结构自带可检测签名,并在湿实验中对 VEGF-A 等靶点验证了功能一致性。

    推荐理由:将数字水印技术延伸至合成生物学领域,在保留蛋白质生物功能的同时实现物理层面的可验证性。

  2. Google Research68

    Google Research 提出 Diffusion Controller 统一图像生成控制框架

    Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级“转向阻尼器”网络动态调整生成轨迹。该框架在灰盒和全白盒环境下均优于 LoRA,实现了更优的质量与效率平衡。

    推荐理由:提出统一控制框架解决图像生成引导难题,在受限访问下优于LoRA。

9月25日周五
  1. Google Research79

    Google 发布 AI 视频联合导演框架及四个长视频生成评测基准

    Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。

    推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。

  2. Google DeepMind77

    Gemini 3.8 Live 新增 Live Avatar 实时视觉形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。

    推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。

9月24日周四
  1. NVIDIA Blog66

    NVIDIA联合发布2800多种病毒蛋白复合物结构数据集

    NVIDIA联合Google DeepMind等机构,通过AlphaFold Database开源2800多种病毒蛋白复合物3D结构。该数据集利用NVIDIA BioNeMo Inference Runtime优化AlphaFold2生成,包含约30%全新相互作用结构,并同步开源BioNeMo Structure Prediction Pipeline供研究人员预测自身目标。

    推荐理由:NVIDIA联合多方开源2800多种病毒蛋白复结构,提供GPU加速预测工具,为未来疫情应对储备关键数据。

  2. Google DeepMind67

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google DeepMind 宣布为 Private AI Compute 平台引入安全的服务端持久记忆功能,解决云端 AI 跨设备连续交互的隐私难题。该架构利用硬件隔离的安全飞地(secure enclave)处理数据,加密密钥仅存储在用户个人设备上,确保即使数据在云端处理也保持端侧隐私标准。同时发布技术白皮书、防篡改软件记录及独立审计报告以验证安全性。

    推荐理由:通过硬件隔离与端侧密钥结合实现云端持久记忆,为跨设备AI助手提供隐私保护方案。

9月23日周三
  1. Google DeepMind82

    Gemini 3.8 Flash TTS 与 Flash-Lite TTS 发布

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示从零创建角色声音、30秒样本复刻声音,并提供逐行表演控制与原生双人对白编排。模型已上线 Google AI Studio 和 Gemini API,并在 Hume AI 语音设计基准测试中取得领先。

    推荐理由:提供了原生双人对白编排与细粒度表演控制,可据此评估其在播客、有声书及多语言配音场景的落地能力。

9月19日周六
9月18日周五
  1. Google Research62

    Google 发布基于 GenUI 的教育模拟生成实验,开放 30 余个 STEM 示例

    Google Research 发布基于生成式 UI(GenUI)的教育模拟生成实验,允许教师动态创建定制化的互动学习模拟。该实验已发布包含物理、化学等学科的 30 余个 AI 生成示例,并开放 Google for Education Pilot Program 供学校申请试用。

    推荐理由:Google 发布基于 GenUI 的教育模拟生成实验,提供 30 余个 STEM 示例并开放教师试点,展示了生成式 UI 在定制教学中的落地路径。

9月16日周三
  1. Google Research68

    Google Research 提出 Retrieve-for-Train:利用强化学习蒸馏加速复杂 AI 搜索

    Google Research 在 ICML 2026 发表论文提出 Retrieve-for-Train 框架,利用离线强化学习发现奖励对齐的查询扩展策略,并将其蒸馏至 53.9M 参数的扩散检索器中。该框架通过单次非自回归并行推理生成完整查询集,在保持多样性和对齐性的同时,相比自回归方法实现 12 至 20 倍的速度提升。

    推荐理由:提出通过离线强化学习将复杂搜索策略蒸馏至轻量扩散模型,实现单次推理并大幅提升检索速度。

  2. Google DeepMind85

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型,支持近实时视觉输入、97 种语言自动切换及后台工具调用。3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数中排名第一,并在 τ-Voice 基准测试中展现多步推理能力。

    推荐理由:新增实时对话与扩展推理能力,提供语音基准数据与多语言支持,便于开发者构建生产级语音智能体。

9月11日周五
  1. Google Research72

    ToolGrad:基于文本梯度的高效工具调用数据集生成方法

    Google Research 提出 ToolGrad,通过文本梯度迭代构建 API 工作流,以更低成本生成高质量工具调用数据。在 BFCL 基准上,基于该方法微调的 Gemma-3-12B 模型得分 83.1,超越 Gemini-2.5-pro、Claude 4.5 Opus 和 GPT-5。

    推荐理由:提出基于文本梯度的答案优先范式,以更低成本生成高质量工具调用数据,使小模型在基准上超越主流闭源模型。

9月8日周二
  1. Google DeepMind83

    Google DeepMind 发布 AlphaGenome Atlas 全基因组变异预测平台

    Google DeepMind 发布 AlphaGenome Atlas,包含人类基因组中90亿种单核苷酸变异的分子影响预测。平台提供 AVI 评分、特征归因及 DNA 序列基序,已用于发现罕见病致病突变及解析复杂性状关联。

    推荐理由:预计算了全基因组90亿种单核苷酸变异,提供AVI评分与可视化门户,加速罕见病与复杂性状研究。

9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球天气 AI 模型,支持每小时更新、最高 5 公里分辨率,并引入实时卫星数据。该模型在降水预测上取得突破,准确率较前代大幅提升,已集成至 Google Search、Gemini、Google Maps 等平台,并向开发者开放数据接口。

    推荐理由:引入实时卫星数据与小时级更新,显著提升降水预测精度并开放给开发者使用。

  2. Google DeepMind78

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 自主漏洞修复能力

    Google DeepMind 推出 Fairwind 计划,向政府和可信合作伙伴开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,实现自主发现并修复代码漏洞。该方案旨在以较低成本在安全云环境中生成可部署补丁,缩短从漏洞检测到修复的时间。

    推荐理由:结合 Gemini 3.8 Flash Cyber 与 CodeMender 提供自主漏洞修复能力,为政企客户提供了规模化防御的可选方案。

  3. Google DeepMind87

    Google DeepMind 发布 Gemini 3.8 Flash 及网络安全版

    Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。

    推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。

9月2日周三
  1. Google Research70

    Google与NASA合作发布基于深度学习的全球甲烷排放卫星检测框架

    Google Research与NASA JPL合作在PNAS发表论文,提出MAPL-EMIT深度学习框架,利用Swin-S视觉Transformer和360万合成数据,实现了对EMIT卫星数据中甲烷羽流的高精度检测与源定位。该模型在专家标注数据上召回率达84%,并开源了全球羽流数据库、训练模型及推理库。

    推荐理由:论文提出结合物理模拟与视觉Transformer的深度学习框架,显著提升了卫星遥感甲烷排放检测的精度与灵敏度。

  2. Google DeepMind82

    Gemini 推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能。该功能通过动态搜索和扫描视频片段,将长视频分析的 token 消耗降低高达 88%,成本降低 66%,准确率提升 7%。

    推荐理由:Gemini 3.7 Flash 等模型新增智能体视频理解功能,通过动态检索显著降低视频分析成本并提升准确率。

8月28日周五
8月27日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,提供实时流式(gemini-3.5-transcribe-live)与离线处理(gemini-3.5-transcribe)双 API。该模型支持函数调用、自定义词汇及 85 种语言,流式与非流式 WER 分别达 4.0% 和 2.6%,已集成至 Gemini 应用、Gboard 及 Chrome 等产品。

    推荐理由:模型提供实时与离线双API,WER显著降低并支持函数调用,开发者可据此构建高精度语音交互应用。

8月22日周六
8月21日周五
  1. Google Research42

    Google Research 提出 ME-POIs 框架,通过融合移动数据增强语言模型对地点的理解

    Google Research 提出 ME-POIs 框架,将匿名移动模式与文本描述融合以增强语言模型对地点的理解。该框架通过自监督方法构建数值向量,使模型能捕捉地点的动态功能节奏。集成该框架后,模型在预测访问意图、价格水平分类和繁忙度估算上分别获得最高 81.9%、75.1% 和 24.7% 的相对提升。

8月17日周一
  1. Google Research70

    Google Research 提出 PhotoScan 利用智能手机图像估算体成分与代谢风险

    Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。

    推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。

8月14日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.7 Flash 模型

    Google DeepMind 发布 Gemini 3.7 Flash,在编码、智能体和复杂文档处理任务上显著优于 3.6 Flash,并提供半价定价。该模型已用于 Gemini Spark,并更新了 CBRN 和网络安全方面的安全护栏。

    推荐理由:在编码和智能体任务上性能显著提升,并提供半价定价,有助于开发者低成本扩展生产级应用。

8月13日周四
  1. Microsoft Research42

    MindTopo 揭示多模态大模型的空间推理能力

    Microsoft Research 发布 MindTopo 基准测试,评估多模态大模型在拓扑推理与规划中的表现。测试涵盖连通性、包围等五类拓扑属性,结果显示当前模型在静态识别上表现尚可,但在交互规划中常因无法维持结构关系而失败。该基准旨在揭示 AI 在机器人等交互环境中理解拓扑结构的差距。

8月12日周三
  1. Google DeepMind85

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。

    推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。

  2. Google Research68

    Google Research:检索是参数化事实性的瓶颈

    Google Research 发布研究,提出知识画像框架并构建 WikiProfile 基准,评估发现前沿模型如 Gemini-3 和 GPT-5 的事实编码已近饱和,但直接检索失败率仍达 26–34%。研究指出长尾事实与反向问题主要面临检索困难,链式推理能恢复约 40–65% 的已编码知识,表明提升事实性的关键在于优化知识利用。

    推荐理由:研究指出前沿模型事实错误主因是检索瓶颈而非知识缺失,链式推理可恢复大量已编码知识。

  3. Google Research88

    Google 发布 AMIE 实时视频问诊研究:达到专家级临床诊断水平

    Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。

    推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 系列气象预测模型

    Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。

    推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。