跳到正文

#Google

今日 5 条
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

6月8日周一
6月5日周五
  1. Google Research72

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 在 Gemini Enterprise Agent Platform 中推出基于 Agentic RAG 的跨语料检索功能。该框架通过编排、规划、重写和搜索等智能体协作,并引入“充分上下文智能体”进行质量校验与迭代搜索,在 FramesQA 测试中较标准 RAG 准确率提升最高达 34%。

    推荐理由:引入具备上下文完整性校验的 Agentic RAG 机制,通过多智能体迭代搜索提升复杂查询的准确率与可靠性。

  2. Google Research68

    Google Research 发布基于手机摄像头的被动心率监测研究

    Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。

    推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。

6月4日周四
  1. Google Research70

    Google 开源水文模型框架,赋能全球洪水预报

    Google Research 在 GitHub 开源了驱动 Flood Hub 的水文模型框架,允许气象机构利用本地数据微调模型。该框架包含基于 LSTM 的模型架构和训练管线,升级模型将可靠预测期延长了六天。

    推荐理由:开源了驱动 Flood Hub 的 AI 水文模型框架,允许气象机构利用本地数据微调模型,提升洪水预报能力。

5月29日周五
5月28日周四
5月22日周五
  1. Google DeepMind22

    Google DeepMind 在亚太地区启动“AI for the Planet”加速器项目

    Google DeepMind 在亚太地区启动首届“AI for the Planet”加速器项目,旨在利用前沿 AI 解决气候、农业和能源等环境挑战。该项目为期三个月,面向初创企业、研究团队和非营利组织,入选者将获得 Google AI 专家的指导及科学 AI 模型集成支持。项目将在新加坡举办线下训练营,目前开放意向注册。

5月20日周三
  1. Google Research73

    Google 发布 ERA 科研工具并推出计算发现平台

    Google 发布 Empirical Research Assistance (ERA) 工具,利用 Gemini 通过树搜索方法编写和优化科学代码,在基因组学、流行病学预测、碳监测等基准测试中达到专家级性能。同时推出基于 ERA 和 AlphaEvolve 的计算发现平台 Computational Discovery,并开放 Gemini for Science 实验工具供注册使用。

    推荐理由:ERA 工具通过树搜索优化科学代码,已在多项基准测试中达到专家级水平,并开放给科研社区使用。

5月19日周二
5月18日周一
  1. Google DeepMind42

    Project Genie 新增 Street View 功能,支持基于真实地点生成虚拟世界

    Google DeepMind 在 Project Genie 中新增 Street View 功能,允许用户基于美国真实地点生成可交互的虚拟世界。该功能结合 Maps Imagery Grounding 技术,支持“Ocean World”等风格,用户可自定义角色探索或重塑现实场景。Project Genie 现已面向全球 18 岁以上 Google AI Ultra 订阅用户开放。

  2. Google DeepMind92

    Google 发布 Gemini Omni Flash 多模态视频生成模型

    Google 发布 Gemini Omni Flash,支持将图像、音频、视频和文本作为输入生成高质量视频,并可通过自然语言对话进行编辑。该模型已面向 Google AI Plus、Pro 和 Ultra 订阅用户以及 YouTube Shorts 用户开放。

    推荐理由:原文给出了多模态输入生成视频的能力细节和开放入口,读者可以据此判断它对现有视频创作工作流的影响。

5月17日周日
  1. Google DeepMind70

    Google 发布 Gemini for Science 实验工具与科学技能

    Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具:基于 Co-Scientist 的假设生成、基于 AlphaEvolve 的计算发现、基于 NotebookLM 的文献洞察,以及集成 AlphaFold 等数据库的 Google Antigravity 科学技能。

    推荐理由:Google 发布 Gemini for Science 系列实验工具与技能,覆盖假设生成、计算发现与文献洞察,提供科研加速新路径。

5月16日周六
  1. Google DeepMind48

    Google DeepMind 发布 Co-Scientist 助力 Calico 衰老研究

    Google DeepMind 发布 Co-Scientist,协助 Calico Life Sciences 在衰老生物学研究中生成可验证假设。该工具帮助研究人员从混杂的文献中识别出关于整合应激反应(ISR)受代谢调节的新颖假设,并优化实验设计。Calico 团队利用 Co-Scientist 筛选噪音并推进实验,最终获得具有健康与疾病意义的新发现。

  2. Google DeepMind40

    Google DeepMind 发布 Co-Scientist 加速肝病机制发现

    Google DeepMind 发布 Co-Scientist,利用 AI 辅助生物医学研究以加速疾病机制发现。该系统帮助爱丁堡大学团队在代谢功能障碍相关脂肪性肝炎(MASH)研究中,通过综合肝脏生物学与药理学证据,提出 NLRP3 炎症小子作为连接炎症与代谢的关键分子桥梁假设。该假设后经实验验证,为靶向双重疗法开发提供了新方向。

  3. Google DeepMind23

    Co-Scientist 助力 MIT 与波士顿儿童医院合作探索 ALS 疗法

    Co-Scientist 帮助 MIT 的 Ritu Ritu Raman 与波士顿儿童医院的 Ryan Flynn 跨越学科壁垒,将组织模型与 RNA 映射技术结合以探索肌萎缩侧索硬化症(ALS)疗法。该工具快速梳理了矛盾文献,协助团队提出可验证假设并评估可行性与风险。双方正利用 Co-Scientist 迭代寻找针对 ALS 的新型 RNA 机制及潜在药物。

  4. Google DeepMind72

    Google DeepMind发布Co-Scientist并验证其在肝纤维化药物发现中的应用

    Google DeepMind发布科研智能体Co-Scientist,斯坦福大学Gary Peltz团队利用其从海量文献中筛选出3种候选药物,并在活体人类肝细胞实验中证实其中2种能阻断肝纤维化并促进细胞再生,其中癌症药物伏立诺他(vorinostat)效果显著,阻断了91%的损伤反应。

    推荐理由:通过斯坦福大学独立实验验证了Co-Scientist在药物重定位中的有效性,为科研工作者提供了可参考的AI辅助发现路径。

5月12日周二
  1. Google DeepMind80

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 发布 Co-Scientist,这是一个基于 Gemini 的多智能体 AI 系统,旨在通过生成、辩论和进化假设来加速科学研究。该系统包含生成、辩论和进化三个阶段,利用“思想锦标赛”机制对假设进行交叉验证和排名,目前已通过 Hypothesis Generation 工具向研究人员开放。

    推荐理由:原文披露了基于 Gemini 的多智能体协作机制与“思想锦标赛”验证流程,为科研场景下的 AI 智能体提供了可迁移的方法论。

5月6日周三
5月2日周六
4月30日周四
  1. Google DeepMind73

    Google DeepMind 发布 AI co-clinician 研究:实时多模态医疗辅助能力评估

    Google DeepMind 发布 AI co-clinician 研究,探索 AI 智能体在医生监督下辅助患者的“三元护理”模式。研究通过 120 次模拟远程问诊对比 GPT-realtime,发现 AI 在 140 项评估指标中 68 项优于初级全科医生,但在识别红旗症状等关键判断上仍不及专家。

    推荐理由:通过对比GPT-realtime等前沿模型,验证了AI在实时多模态问诊中的能力边界与临床辅助价值。

4月27日周一
  1. Google DeepMind45

    Google DeepMind 与韩国科学技术信息通信部达成合作

    Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作伙伴关系,将在首尔设立 AI Campus 以支持韩国 AI 战略。双方将利用 Gemini 驱动的 AlphaFold、AlphaGenome 等前沿 AI for Science 模型,加速生命科学、能源及气象领域的科研突破。此外,合作还涵盖人才培养及与韩国 AI 安全研究所(AISI)的安全研究协作。

4月23日周四
4月22日周三
  1. Google Research68

    Google Research 发布 ReasoningBank 智能体经验学习框架

    Google Research 发布论文介绍 ReasoningBank,一种让智能体从成功与失败经验中学习并自我进化的记忆框架。该框架提炼全局推理模式,结合记忆感知测试时扩展(MaTTS)提升 WebArena 和 SWE-Bench-Verified 上的成功率与效率。

    推荐理由:提出从成功与失败经验中提炼结构化推理模式的记忆框架,结合测试时扩展实现智能体自我进化。

4月16日周四
  1. Google Research36

    Google Research 发布 MoGen 模型,利用 AI 合成神经元加速大脑连接组学重建

    Google Research 发布 MoGen 模型,利用 AI 合成神经元加速大脑连接组学重建。该模型基于 PointInfinity 点云流匹配技术生成逼真的 3D 神经元形态,将其加入 PATHFINDER 训练数据后,小鼠轴突重建错误率降低 4.4%。这一改进相当于在全脑规模下节省 157 人年的手动校对时间,MoGen 已作为开源模型发布。

  2. Google DeepMind75

    Gemini 3.1 Flash TTS 发布,引入细粒度音频标签实现自然语言控制

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,引入细粒度音频标签(audio tags)支持自然语言控制语音风格、节奏和表达。该模型支持 70 多种语言,在 Artificial Analysis 基准测试中表现优异,已面向开发者、企业和 Workspace 用户开放预览,所有生成音频均嵌入 SynthID 水印。

    推荐理由:引入细粒度音频标签实现自然语言控制,兼顾高音质与低成本,为开发者提供精准表达控制。

4月13日周一
  1. Google DeepMind76

    Gemini Robotics-ER 1.6 发布,增强具身推理与仪表读取能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,显著增强空间推理、多视角理解及仪表读取能力。该模型支持通过 Gemini API 和 Google AI Studio 调用,具备通过代码执行与视觉推理实现高精度仪表读数,并提升了物理安全约束遵循能力。

    推荐理由:新增仪表读取与多视角推理能力,为具身智能体提供可验证的物理世界交互方案。

4月9日周四
  1. Google Research60

    Google 发布 PaperVizAgent 与 ScholarPeer 两个科研 AI 智能体

    Google Research 发布两个实验性 AI 智能体:PaperVizAgent 可从文本自动生成出版级学术图表,在多项指标上超越 GPT-Image-1.5 等基线;ScholarPeer 模拟资深审稿人,通过多智能体协作和实时文献检索生成深度评审意见。

    推荐理由:Google 发布两个实验性 AI 智能体,分别用于生成高质量学术图表和模拟资深审稿人,展示了 AI 深度介入科研流程的潜力。

4月1日周三
  1. Google Research38

    Google Research:构建更可靠的 AI 基准测试,需要多少标注员才够?

    Google Research 发布研究指出,AI 基准测试中常见的 3-5 名标注员标准往往不足以捕捉人类意见的细微差异,建议每条目使用超过 10 名标注员。研究通过模拟测试发现,标注策略取决于评估指标:追求准确率时增加条目数量更有效,而捕捉观点多样性则需增加标注员数量。在优化比例后,仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。

3月31日周二
  1. Google Research68

    Google Research 发布论文估算量子计算机破解加密货币的量子资源

    Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。

    推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。

3月29日周日
  1. Google DeepMind72

    Google DeepMind 发布 AI 指针概念,探索 Gemini 驱动的跨应用交互

    Google DeepMind 发布 AI 指针概念,展示基于 Gemini 的原型,通过视觉与语义理解实现跨应用自然交互。该功能已集成至 Chrome 和 Googlebook,支持在网页中直接询问特定内容或进行可视化对比。

    推荐理由:文章展示了基于 Gemini 的 AI 指针原型,通过自然语言与视觉上下文结合,探索跨应用无缝交互的新范式。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live 语音模型,在 ComplexFuncBench Audio 基准测试中得分 90.8%,支持更自然的对话与多语言实时交互。该模型已上线 Gemini Enterprise、Gemini Live 和 Search Live,并集成 SynthID 音频水印。

    推荐理由:模型在语音基准测试中刷新纪录并降低延迟,为开发者构建语音智能体提供了更可靠的底层能力。

  2. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro 音乐生成模型

    Google DeepMind 发布 Lyria 3 Pro,支持生成长达3分钟且具备结构意识的音乐曲目,可自定义前奏、主歌等元素。该模型已接入 Vertex AI、Google AI Studio、Google Vids、Gemini 应用及 ProducerAI,面向企业和创作者开放。

    推荐理由:模型支持3分钟长曲并细化结构控制,同时扩展至多个Google产品,可据此评估其工作流整合价值。

3月25日周三
  1. Google Research75

    Google 发布 Vibe Coding XR 工作流加速 AI + XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为功能性的 Android XR 应用。该工作流利用 Gemini 进行多步规划与空间逻辑处理,在 60 秒内生成包含物理感知和交互的 3D 体验,并提供了桌面模拟器与 Android XR 头显的实时预览功能。

    推荐理由:原文展示了利用 Gemini 长上下文推理将自然语言直接转化为 XR Blocks 应用的完整工作流,为空间计算原型开发提供了可复用的新范式。

  2. Google Research68

    Google 发布 TurboQuant:零精度损失的 KV 缓存压缩算法

    Google Research 发布 TurboQuant 算法,结合 PolarQuant 和 QJL 技术实现零精度损失的向量量化。该算法将 KV 缓存压缩至少 6 倍,在 Gemma 和 Mistral 模型上实现最高 8 倍推理加速,并显著提升高维向量搜索召回率。

    推荐理由:TurboQuant 通过零开销量化将 KV 缓存压缩 6 倍并加速推理,为长上下文场景提供了可迁移的高效压缩方案。