Google Research 发布基于手机摄像头的被动心率监测研究
Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。
推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。
推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。
Hugging Face转载Dharma AI论文,展示在SFT后引入DPO阶段,利用模型自身的退化输出作为拒绝样本,在五个视觉语言模型家族中平均降低59.4%的文本退化率。
推荐理由:文章验证了DPO在结构化OCR任务中抑制文本退化,为无标注场景下的模型优化提供了可迁移的方法。
Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。
推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。
Google DeepMind 发布 AI co-clinician 研究,探索 AI 智能体在医生监督下辅助患者的“三元护理”模式。研究通过 120 次模拟远程问诊对比 GPT-realtime,发现 AI 在 140 项评估指标中 68 项优于初级全科医生,但在识别红旗症状等关键判断上仍不及专家。
推荐理由:通过对比GPT-realtime等前沿模型,验证了AI在实时多模态问诊中的能力边界与临床辅助价值。
Google Research发布实证研究,展示Empirical Research Assistance (ERA) 结合Gemini Deep Think在公共卫生预测、宇宙学、气候监测和神经科学中的实际应用。
推荐理由:通过四个跨学科案例展示ERA结合Gemini Deep Think在科学发现中的具体应用与能力边界。
Google Research 发布论文介绍 ReasoningBank,一种让智能体从成功与失败经验中学习并自我进化的记忆框架。该框架提炼全局推理模式,结合记忆感知测试时扩展(MaTTS)提升 WebArena 和 SWE-Bench-Verified 上的成功率与效率。
推荐理由:提出从成功与失败经验中提炼结构化推理模式的记忆框架,结合测试时扩展实现智能体自我进化。
Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。
推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。
Google Research 发布 TurboQuant 算法,结合 PolarQuant 和 QJL 技术实现零精度损失的向量量化。该算法将 KV 缓存压缩至少 6 倍,在 Gemma 和 Mistral 模型上实现最高 8 倍推理加速,并显著提升高维向量搜索召回率。
推荐理由:TurboQuant 通过零开销量化将 KV 缓存压缩 6 倍并加速推理,为长上下文场景提供了可迁移的高效压缩方案。
Google Research 发布 S2Vec,一种自监督框架,利用 S2 几何分区和掩码自编码将城市建成环境转化为通用嵌入向量。该模型在零样本地理适应任务中表现优异,能预测人口密度和收入等社会经济指标,但在环境任务中需结合卫星图像。
推荐理由:提出自监督框架将城市建成环境转化为通用嵌入向量,在零样本地理适应任务中表现优异。
Google Research 联合英国 NHS 发表两项研究,证实 AI 辅助乳腺癌筛查系统在双读流程中表现不劣于纯人工,且可减少 46% 的人工阅片工作量。AI 在独立检测中灵敏度高于首位放射科医生,能识别 25% 的漏诊间期癌,但需解决模型可解释性及数据漂移问题。
推荐理由:研究证实AI辅助双读流程在保持检测准确率的同时,可显著减少放射科医生工作量,为缓解医疗人力短缺提供实证。
Google 与康奈尔大学合作在 PNAS 发表论文,评估 GPT-4o、Claude 3.5 等六款 LLM 在高能超导领域的专家级问答表现。基于精选文献的 NotebookLM 和自建 RAG 系统在准确性、平衡性和证据支持上优于开放网络模型。研究指出模型在视觉推理和时序理解上仍有不足,并将发布 CMT-benchmark 进行更严格评估。
推荐理由:通过专家盲评对比发现,基于精选文献的 NotebookLM 在科学准确性上优于开放网络模型,揭示了 RAG 在科研场景中的关键价值。
Google Research发布AMIE在真实门诊环境中的前瞻性可行性研究,结果显示系统在100名患者中零安全拦截,诊断准确率在90%的最终诊断中匹配,且医患体验良好。
推荐理由:研究在真实门诊场景中验证了AMIE的安全性与诊断准确性,为医疗AI的临床落地提供了实证依据。
Google Research 发表论文,提出通过监督微调让大语言模型模仿贝叶斯助手,从而学会概率推理。该方法使模型在航班推荐任务中显著优于基线,并能将学到的推理能力泛化至酒店推荐和网购等未见领域。
推荐理由:研究提出通过模仿贝叶斯模型进行监督微调,使大模型学会概率推理并跨领域泛化。
Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。
推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。
推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。
Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。
推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。
Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。
推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。
Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。
推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。