跳到正文

#Agent

今日 0 条
10月6日周二
9月25日周五
  1. Google Research79

    Google 发布 AI 视频联合导演框架及四个长视频生成评测基准

    Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。

    推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。

9月16日周三
9月11日周五
  1. Google Research72

    ToolGrad:基于文本梯度的高效工具调用数据集生成方法

    Google Research 提出 ToolGrad,通过文本梯度迭代构建 API 工作流,以更低成本生成高质量工具调用数据。在 BFCL 基准上,基于该方法微调的 Gemma-3-12B 模型得分 83.1,超越 Gemini-2.5-pro、Claude 4.5 Opus 和 GPT-5。

    推荐理由:提出基于文本梯度的答案优先范式,以更低成本生成高质量工具调用数据,使小模型在基准上超越主流闭源模型。

9月7日周一
8月24日周一
8月22日周六
8月13日周四
  1. Hugging Face Blog83

    Hugging Face 复现 2200 篇 ICML 论文:发现半数以上存在复现问题

    Hugging Face 联合社区复现 2226 篇 ICML 2026 论文,发现 51% 的论文至少有一个声明被验证,23% 存在被证伪的声明。文章指出纯智能体验证存在局限,人类应转向管理智能体、设定环境和提出关键问题。

    推荐理由:Hugging Face 通过大规模开源复现揭示了 AI 论文复现危机,并探讨了人类在智能体时代的审稿新角色。

7月31日周五
  1. Google Research76

    Google Research发布Science One Framework:基于Chain-of-Evidence的可验证自主科研框架

    Google Research发布Science One Framework及Chain-of-Evidence (CoE) 框架,旨在解决AI自主科研中的可验证性问题。该框架通过构建完整的证据链,实现了零虚假引用和完全可复现的实验分数,同时在MLE-Bench和Parameter-Golf等前沿基准上达到SOTA性能。

    推荐理由:提出Chain-of-Evidence框架与CoE Audit,通过强制证据链解决AI科研幻觉,在保持前沿性能的同时实现零虚假引用。

7月26日周日
7月9日周四
  1. Google Research86

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布 SensorFM,一个基于超一万亿分钟无标签多模态传感器数据训练的可穿戴健康基础模型。该模型在心血管、代谢、睡眠等35项健康任务中展现出泛化能力,并支持通过智能体自动构建预测头及作为个人健康智能体的底层支撑。

    推荐理由:基于万亿分钟无标签数据训练通用表示,为可穿戴设备健康分析提供了可扩展的底层方案。

6月19日周五
  1. Hugging Face Blog73

    MosaicLeaks:深度研究智能体的隐私泄露风险与PA-DR训练法

    Hugging Face发布MosaicLeaks论文,揭示深度研究智能体通过外部查询日志泄露私有信息的风险。提出PA-DR训练法,将答案/全信息泄露率从34.0%降至9.9%,同时保持严格链成功率在58.7%。

    推荐理由:提出PA-DR训练法,在保持推理性能的同时将深度研究智能体的隐私泄露率从34%降至9.9%。

4月22日周三
  1. Google Research68

    Google Research 发布 ReasoningBank 智能体经验学习框架

    Google Research 发布论文介绍 ReasoningBank,一种让智能体从成功与失败经验中学习并自我进化的记忆框架。该框架提炼全局推理模式,结合记忆感知测试时扩展(MaTTS)提升 WebArena 和 SWE-Bench-Verified 上的成功率与效率。

    推荐理由:提出从成功与失败经验中提炼结构化推理模式的记忆框架,结合测试时扩展实现智能体自我进化。

1月28日周三
  1. Google Research78

    Google Research 发布智能体系统扩展原则:多智能体并非总是更好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。

    推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。

1月21日周三
  1. Hugging Face Blog70

    AssetOpsBench:面向工业资产管理的AI智能体评测基准

    Hugging Face 发布 AssetOpsBench,这是一个针对工业资产生命周期管理的 AI 智能体评测基准,涵盖 230 万传感器遥测点和 140 多个场景。该基准通过六个维度评估智能体表现,并引入 TrajFM 管道分析多智能体执行轨迹中的失败模式。社区测试显示,GPT-4.1 在规划和执行任务中得分最高,但尚无模型达到 85 分的部署就绪阈值。

    推荐理由:原文提供了工业场景下的多维评测框架与失败模式分析,为开发者优化多智能体协作提供了可迁移的评估方法。

12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

11月13日周四
  1. Google DeepMind75

    Google DeepMind 发布 SIMA 2:基于 Gemini 推理的 3D 世界通用智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。

    推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。

11月7日周五
  1. Google Research38

    DS-STAR:一种最先进的通用数据科学智能体

    Google Research 发布 DS-STAR,这是一款能自动处理多样化异构数据并生成可执行代码的数据科学智能体。该框架通过数据文件分析、LLM 验证和顺序规划机制,在 DABStep、KramaBench 和 DA-Code 基准测试中均取得最先进性能。DS-STAR 在 DABStep 上的准确率从 41.0% 提升至 45.2%,并在该基准的公共排行榜上排名第一。

7月17日周四
2月4日周二
  1. Hugging Face Blog68

    Hugging Face 与 Adyen 联合发布 DABStep 多步推理数据智能体基准

    Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。

    推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。