跳到正文

全部动态

今日 0 条
6月24日周三
  1. Hugging Face Blog67

    Hugging Face 联合 Treble 推出 FFASR 远场语音识别基准

    Hugging Face 联合 Treble 推出首个开源远场语音识别(FFASR)基准,覆盖 14 种模拟房间与多信噪比条件。评测显示远场低信噪比下的字错误率显著高于近场,并提供准确率与推理速度的权衡分析。

    推荐理由:首次公开远场语音识别基准,提供仿真与实测对照,直观展示真实声学环境下的性能差距。

6月19日周五
  1. Hugging Face Blog73

    MosaicLeaks:深度研究智能体的隐私泄露风险与PA-DR训练法

    Hugging Face发布MosaicLeaks论文,揭示深度研究智能体通过外部查询日志泄露私有信息的风险。提出PA-DR训练法,将答案/全信息泄露率从34.0%降至9.9%,同时保持严格链成功率在58.7%。

    推荐理由:提出PA-DR训练法,在保持推理性能的同时将深度研究智能体的隐私泄露率从34%降至9.9%。

6月17日周三
6月11日周四
  1. Google Research42

    Google Research 提出正则化 f-散度核检验框架以审计机器学习遗忘

    Google Research 提出正则化 f-散度核检验框架,旨在解决大规模模型机器遗忘审计中传统两样本检验统计效力低且计算昂贵的问题。该框架利用 f-散度(如 KL 散度、Hockey-stick 散度)结合核正则化方法,自动选择最佳散度类型以精准定位局部数据偏移。该研究已在 AISTATS 2026 发表,理论上证明了其对假阳性的控制能力及随样本增加假阴性收敛至零的特性。

6月5日周五
  1. Google Research68

    Google Research 发布基于手机摄像头的被动心率监测研究

    Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。

    推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。

6月3日周三
5月28日周四
5月8日周五
  1. Berkeley AI Research68

    自适应并行推理:高效推理扩展的新范式

    Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。

    推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。

4月22日周三
  1. Google Research68

    Google Research 发布 ReasoningBank 智能体经验学习框架

    Google Research 发布论文介绍 ReasoningBank,一种让智能体从成功与失败经验中学习并自我进化的记忆框架。该框架提炼全局推理模式,结合记忆感知测试时扩展(MaTTS)提升 WebArena 和 SWE-Bench-Verified 上的成功率与效率。

    推荐理由:提出从成功与失败经验中提炼结构化推理模式的记忆框架,结合测试时扩展实现智能体自我进化。

4月20日周一
4月16日周四
  1. Google Research36

    Google Research 发布 MoGen 模型,利用 AI 合成神经元加速大脑连接组学重建

    Google Research 发布 MoGen 模型,利用 AI 合成神经元加速大脑连接组学重建。该模型基于 PointInfinity 点云流匹配技术生成逼真的 3D 神经元形态,将其加入 PATHFINDER 训练数据后,小鼠轴突重建错误率降低 4.4%。这一改进相当于在全脑规模下节省 157 人年的手动校对时间,MoGen 已作为开源模型发布。

4月1日周三
  1. Google Research38

    Google Research:构建更可靠的 AI 基准测试,需要多少标注员才够?

    Google Research 发布研究指出,AI 基准测试中常见的 3-5 名标注员标准往往不足以捕捉人类意见的细微差异,建议每条目使用超过 10 名标注员。研究通过模拟测试发现,标注策略取决于评估指标:追求准确率时增加条目数量更有效,而捕捉观点多样性则需增加标注员数量。在优化比例后,仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。

3月31日周二
  1. Google Research68

    Google Research 发布论文估算量子计算机破解加密货币的量子资源

    Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。

    推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。

3月25日周三
  1. Google Research68

    Google 发布 TurboQuant:零精度损失的 KV 缓存压缩算法

    Google Research 发布 TurboQuant 算法,结合 PolarQuant 和 QJL 技术实现零精度损失的向量量化。该算法将 KV 缓存压缩至少 6 倍,在 Gemma 和 Mistral 模型上实现最高 8 倍推理加速,并显著提升高维向量搜索召回率。

    推荐理由:TurboQuant 通过零开销量化将 KV 缓存压缩 6 倍并加速推理,为长上下文场景提供了可迁移的高效压缩方案。

  2. Google Research62

    Google Research 发布 S2Vec 框架学习城市建成环境特征

    Google Research 发布 S2Vec,一种自监督框架,利用 S2 几何分区和掩码自编码将城市建成环境转化为通用嵌入向量。该模型在零样本地理适应任务中表现优异,能预测人口密度和收入等社会经济指标,但在环境任务中需结合卫星图像。

    推荐理由:提出自监督框架将城市建成环境转化为通用嵌入向量,在零样本地理适应任务中表现优异。

3月18日周三
  1. Google Research75

    Google Research 发布 AI 辅助乳腺癌筛查研究:双读流程可减 46% 工作量

    Google Research 联合英国 NHS 发表两项研究,证实 AI 辅助乳腺癌筛查系统在双读流程中表现不劣于纯人工,且可减少 46% 的人工阅片工作量。AI 在独立检测中灵敏度高于首位放射科医生,能识别 25% 的漏诊间期癌,但需解决模型可解释性及数据漂移问题。

    推荐理由:研究证实AI辅助双读流程在保持检测准确率的同时,可显著减少放射科医生工作量,为缓解医疗人力短缺提供实证。

  2. Google DeepMind43

    Google DeepMind 发布 AGI 认知评估框架

    Google DeepMind 发布“AGI 认知分类”框架,提出感知、推理等 10 项关键认知能力以衡量通用人工智能进展。该框架配套发布 Kaggle 黑客松,邀请社区针对学习、元认知等五项能力构建评估基准。活动提供 20 万美元奖金池,提交截止至 4 月 16 日。

3月17日周二
  1. Google Research60

    Google 研究论文:LLM 在超导领域专家级问答中的表现评估

    Google 与康奈尔大学合作在 PNAS 发表论文,评估 GPT-4o、Claude 3.5 等六款 LLM 在高能超导领域的专家级问答表现。基于精选文献的 NotebookLM 和自建 RAG 系统在准确性、平衡性和证据支持上优于开放网络模型。研究指出模型在视觉推理和时序理解上仍有不足,并将发布 CMT-benchmark 进行更严格评估。

    推荐理由:通过专家盲评对比发现,基于精选文献的 NotebookLM 在科学准确性上优于开放网络模型,揭示了 RAG 在科研场景中的关键价值。

3月13日周五
  1. Berkeley AI Research42

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,实现大规模 LLM 交互作用的高效识别

    Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,通过稀疏恢复和层级结构特性,以极少消融次数高效识别 LLM 中的关键交互作用。ProxySPEX 在保持 SPEX 性能的同时,将消融次数减少约 10 倍。该方法在数千特征的上下文窗口中仍能保持高忠实度,显著优于 LIME 等边际方法。

3月12日周四
  1. Google Research73

    Google发布AMIE真实世界临床可行性研究结果

    Google Research发布AMIE在真实门诊环境中的前瞻性可行性研究,结果显示系统在100名患者中零安全拦截,诊断准确率在90%的最终诊断中匹配,且医患体验良好。

    推荐理由:研究在真实门诊场景中验证了AMIE的安全性与诊断准确性,为医疗AI的临床落地提供了实证依据。

3月7日周六
3月5日周四
  1. Google Research65

    Google Research:通过模仿贝叶斯模型训练大语言模型

    Google Research 发表论文,提出通过监督微调让大语言模型模仿贝叶斯助手,从而学会概率推理。该方法使模型在航班推荐任务中显著优于基线,并能将学到的推理能力泛化至酒店推荐和网购等未见领域。

    推荐理由:研究提出通过模仿贝叶斯模型进行监督微调,使大模型学会概率推理并跨领域泛化。

2月18日周三
  1. Google Research68

    Google发布MapTrace合成数据管线,提升多模态大模型地图路径追踪能力

    Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。

    推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。

2月11日周三
  1. Google Research15

    时变容量下非抢占式调度最大化吞吐量研究

    Google Research 在 SPAA 2025 发表研究,针对时变容量环境下的非抢占式作业调度问题,提出最大化吞吐量的常数因子近似算法。离线场景中,Greedy 策略在单位利润下实现 1/2-近似,不同利润下实现 1/4-近似。在线场景中,允许重启的 Greedy 变体保持 1/2-竞争比,而禁止重启的严格模型下算法性能受限。

2月10日周二
2月4日周三
  1. Google Research75

    Google联合Included Health启动全美医疗AI真实世界随机对照试验

    Google宣布与Included Health合作,在获得IRB批准后启动全美随机对照试验,评估对话式AI在真实虚拟护理工作流中的表现。该研究基于AMIE、PHA等前期基础,旨在通过大规模真实患者数据验证AI的安全性与有效性。

    推荐理由:Google联合Included Health启动全美随机对照试验,标志着医疗AI从实验室模拟走向真实世界的大规模临床验证。

1月28日周三
  1. Google Research78

    Google Research 发布智能体系统扩展原则:多智能体并非总是更好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。

    推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。

1月24日周六
1月23日周五
  1. Google Research60

    Google 提出通过分解实现小模型优越意图提取

    Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。

    推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。

1月21日周三
  1. Hugging Face Blog70

    AssetOpsBench:面向工业资产管理的AI智能体评测基准

    Hugging Face 发布 AssetOpsBench,这是一个针对工业资产生命周期管理的 AI 智能体评测基准,涵盖 230 万传感器遥测点和 140 多个场景。该基准通过六个维度评估智能体表现,并引入 TrajFM 管道分析多智能体执行轨迹中的失败模式。社区测试显示,GPT-4.1 在规划和执行任务中得分最高,但尚无模型达到 85 分的部署就绪阈值。

    推荐理由:原文提供了工业场景下的多维评测框架与失败模式分析,为开发者优化多智能体协作提供了可迁移的评估方法。

1月20日周二
  1. Hugging Face Blog40

    DIFF Transformer V2 发布

    微软发布 DIFF Transformer V2,通过差分注意力机制在保持键值头数量不变的前提下倍增查询头,实现与标准 Transformer 相当的解码速度。该版本移除了 DIFF V1 中导致数值不稳定的逐头 RMSNorm 层,有效消除注意力汇聚现象。相比同等查询维度的 Transformer,DIFF V2 在输出投影阶段拥有更少的参数和计算量。

1月16日周五
  1. Google DeepMind68

    Google DeepMind 发布 D4RT 统一4D场景重建与追踪模型

    Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。

    推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。

  2. Google Research50

    Google Research 利用 Pixel Watch 和深度学习模型估算高级步态指标

    Google Research 发布研究证明消费级智能手表可准确估算步速、步长等时空步态指标。该研究基于 246 名参与者的约 70,000 个步行片段,使用搭载时间卷积网络(TCN)的深度学习模型处理 Pixel Watch 的 IMU 数据。结果显示智能手表估算结果与智能手机方法性能相当,多数指标效度(Pearson r >0.80)和信度(ICC >0.80)良好。

1月13日周二
  1. Google Research80

    Google发布NeuralGCM降水研究:卫星数据训练提升长期模拟精度

    Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。

    推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。

1月10日周六
  1. Berkeley AI Research35

    基于信息论直接评估与优化成像系统

    伯克利 AI 研究团队提出一种基于互信息的框架,直接评估并优化成像系统。该方法通过分解噪声物理特性,仅需测量数据即可量化系统区分物体的能力。在色彩摄影、射电天文、无透镜成像和显微镜四个领域验证中,信息估计准确预测了下游任务性能,且优化结果匹配最先进端到端方法,同时显著降低内存和算力需求。

12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

12月11日周四
  1. Google Research42

    Urania:基于差分隐私的 AI 聊天机器人使用洞察框架

    Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。