跳到正文

#Agent

今日 12 条
3月18日周三
  1. Google Research65

    Google Research 在 The Check Up 大会展示医疗AI从创新到临床落地的进展

    Google Research 在 The Check Up 大会上展示了AI在医疗领域的最新进展,涵盖从个性化健康到临床辅助的多个方向。在临床协作方面,与 NHS 合作的研究显示AI可识别25%的漏诊乳腺癌,并联合 Beth Israel Deaconess 测试 AMIE 多智能体系统。

    推荐理由:系统展示了从临床辅助到公共卫生到科研加速的AI应用全景,揭示了多模态与智能体在医疗场景的落地路径。

3月11日周三
  1. Mistral AI75

    Mistral AI 开源 Vibe 智能体实现 Rails 测试自动化

    Mistral AI 基于开源编码助手 Vibe 构建了一个自动化测试智能体,可读取 Rails 源码并生成或改进 RSpec 测试。该智能体通过 AGENTS.md 进行上下文工程、使用分类 SKILLS 文件以及集成 RuboCop 和 SimpleCov 自定义工具,在 CI/CD 中无需人工干预即可运行。

    推荐理由:原文给出了基于Vibe构建Rails测试智能体的具体工程方法,读者可据此复现自动化测试生成流程。

2月11日周三
  1. Google Research55

    Google Research 发布开源框架 DialogLab 用于模拟多角色动态人机对话

    Google Research 发布开源原型框架 DialogLab,用于设计、模拟和测试动态多角色人机对话。该框架通过可视化界面解耦社交设置与对话流程,支持拖拽式角色配置与结构化脚本编排。评估显示,其“人工控制”模式在模拟真实人类行为时比全自动或纯响应式代理更具沉浸感和有效性。

2月10日周二
  1. Google DeepMind88

    Google DeepMind发布Gemini Deep Think科研级应用与数学研究智能体

    Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。

    推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。

2月5日周四
1月28日周三
  1. Google Research78

    Google Research 发布智能体系统扩展原则:多智能体并非总是更好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种配置评估指出多智能体并非总是更好。研究发现并行任务中集中式协调可提升 80.9% 性能,而顺序任务中多智能体会导致 39-70% 的性能下降,并提出了基于任务属性的架构预测模型。

    推荐理由:研究量化了多智能体协作的增益与惩罚,为不同任务选择架构提供了可迁移的定量原则。

  2. Mistral AI72

    Mistral Vibe 2.0 发布,引入自定义子智能体与多选项澄清功能

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,基于 Devstral 2 模型,新增自定义子智能体、多选项澄清、斜杠命令技能及统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 计划中提供,支持按量付费或自带 API 密钥,Devstral 2 模型也转为付费 API 访问。

    推荐理由:提供了自定义子智能体和多选项澄清等控制能力,有助于开发者构建更可控的终端自动化工作流。

1月21日周三
  1. Hugging Face Blog70

    AssetOpsBench:面向工业资产管理的AI智能体评测基准

    Hugging Face 发布 AssetOpsBench,这是一个针对工业资产生命周期管理的 AI 智能体评测基准,涵盖 230 万传感器遥测点和 140 多个场景。该基准通过六个维度评估智能体表现,并引入 TrajFM 管道分析多智能体执行轨迹中的失败模式。社区测试显示,GPT-4.1 在规划和执行任务中得分最高,但尚无模型达到 85 分的部署就绪阈值。

    推荐理由:原文提供了工业场景下的多维评测框架与失败模式分析,为开发者优化多智能体协作提供了可迁移的评估方法。

1月15日周四
12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

12月19日周五
12月17日周三
  1. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

12月16日周二
  1. Hugging Face Blog72

    开源智能体框架CUGA上线Hugging Face Spaces

    IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。

    推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。

12月4日周四
  1. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

11月25日周二
11月19日周三
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3 Pro 模型

    Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。

    推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。

11月13日周四
  1. Google DeepMind75

    Google DeepMind 发布 SIMA 2:基于 Gemini 推理的 3D 世界通用智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。

    推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。

11月7日周五
  1. Google Research38

    DS-STAR:一种最先进的通用数据科学智能体

    Google Research 发布 DS-STAR,这是一款能自动处理多样化异构数据并生成可执行代码的数据科学智能体。该框架通过数据文件分析、LLM 验证和顺序规划机制,在 DABStep、KramaBench 和 DA-Code 基准测试中均取得最先进性能。DS-STAR 在 DABStep 上的准确率从 41.0% 提升至 45.2%,并在该基准的公共排行榜上排名第一。

10月30日周四
  1. Hugging Face Blog55

    MiniMax M2 智能体泛化:对齐基准还是现实?

    MiniMax M2 作者分享了智能体后训练中的对齐经验,指出模型需具备交错思考能力以应对长上下文和外部扰动。文章强调智能体泛化不仅是工具扩展,更是对整个操作空间扰动的适应,建议用户保留完整会话历史以获得最佳性能。

10月23日周四
9月29日周一
9月23日周二
  1. Hugging Face Blog72

    Hugging Face 开源 Smol2Operator GUI 智能体训练全流程

    Hugging Face 开源了 Smol2Operator 项目,展示了如何将轻量级视觉语言模型 SmolVLM2-2.2B-Instruct 训练为具备 GUI 操作能力的智能体。项目包含两阶段训练策略、统一动作空间转换工具、两个处理后的数据集及最终模型,在 ScreenSpot-v2 基准测试中取得了显著性能提升。

    推荐理由:开源了基于SmolVLM2训练GUI智能体的全流程与模型,提供了可复现的数据处理工具与统一动作空间方案。

9月10日周三
  1. Hugging Face Blog74

    Hugging Face 发布 Jupyter Agent:开源微调 Qwen3-4B 数据分析智能体

    Hugging Face 发布 Jupyter Agent,开源了基于 Qwen3-4B 微调的模型及训练数据集,旨在让小型模型具备在 Jupyter Notebook 中执行代码解决数据分析任务的能力。该模型在 DABStep 基准测试的简单任务上准确率提升至 75%,并提供了完整的 Kaggle 数据集清洗、QA 生成及微调代码。

    推荐理由:Hugging Face 开源了基于 Qwen3-4B 微调的 Jupyter Agent 模型及数据集,展示了通过高质量数据与精简脚手架提升小模型数据分析能力的有效路径。

9月2日周二
  1. Mistral AI68

    Mistral Le Chat 发布记忆功能

    Mistral Le Chat 发布记忆功能(beta),采用图架构实现跨会话信息检索。该功能支持自动保存与智能召回,提供透明度、用户控制权及数据可移植性,并附带 Memory Insights 辅助管理。

    推荐理由:原文披露了记忆功能的底层架构与用户控制权设计,读者可据此评估其实际工作流价值。

  2. Mistral AI72

    Mistral Le Chat 发布 MCP 连接器目录与记忆功能

    Mistral 发布 Le Chat 的 MCP 连接器目录(beta),提供20+个涵盖数据、生产力、开发等领域的安全连接器,支持自定义扩展。同时推出记忆功能(beta),可跨会话保存偏好与事实,支持从 ChatGPT 快速导入,所有功能对免费用户开放。

    推荐理由:Le Chat 新增 MCP 连接器目录与记忆功能,提供企业级数据集成与个性化上下文能力。

8月18日周一
8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

  2. Hugging Face Blog68

    NVIDIA 开源 AI-Q 智能体栈,Llama Nemotron 登顶 DeepResearch Bench

    NVIDIA 发布开源 AI-Q 智能体栈,基于 Llama 3.3-70B 和 Llama-3.3-Nemotron-Super-49B-v1.5 模型,在 Hugging Face DeepResearch Bench 的 LLM with Search 类别中以 40.52 分登顶。该方案支持本地部署与隐私合规,提供完整的推理追踪与评估指标。

    推荐理由:NVIDIA 开源 AI-Q 智能体栈并在 DeepResearch Bench 登顶,展示了 Llama Nemotron 在复杂推理任务中的能力。

7月31日周四
  1. Hugging Face Blog72

    Gradio 新增 MCP 支持:构建具备虚拟试穿能力的 AI 购物助手

    Hugging Face 官方博客介绍 Gradio 新增 Model Context Protocol (MCP) 集成,可将 Python 函数自动转换为 LLM 工具。文章演示了如何利用该功能结合 IDM-VTON 模型和 Playwright,在 VS Code 中构建一个能自动浏览网页并生成虚拟试穿效果的 AI 购物助手。

    推荐理由:Gradio 新增 MCP 支持可将 Python 函数自动转为 LLM 工具,本文演示了如何快速构建具备网页浏览与虚拟试穿能力的 AI 助手。

7月17日周四
  1. Mistral AI68

    Mistral Le Chat 新增 Deep Research 智能体与 Voxtral 语音功能

    Mistral 发布 Le Chat 多项新功能,包括 Deep Research 智能体可自动生成结构化研究报告;基于 Voxtral 模型的语音模式支持自然对话;Magistral 推理模型提供原生多语言思考能力;Projects 功能支持将对话分组管理;与 Black Forest Labs 合作实现图像直接编辑。

    推荐理由:Le Chat 新增 Deep Research 智能体、Voxtral 语音交互及 Magistral 多语言推理,提供了更完整的 AI 助手工作流。

  2. Hugging Face Blog60

    Gradio 5.38.0 更新:增强 MCP 服务器支持

    Gradio 5.38.0 版本更新,增强了对 MCP 服务器协议的支持。新增功能包括:支持本地文件上传、实时进度通知、一行代码将 OpenAPI 规范转换为 MCP 服务器、通过 gr.Header 简化认证配置以及自定义工具描述。

    推荐理由:Gradio 5.38.0 新增文件上传、OpenAPI 转换等 MCP 功能,降低了构建智能体应用的技术门槛。

7月11日周五
  1. Mistral AI78

    Mistral 发布 Devstral Medium 及升级 Devstral Small 1.1

    Mistral AI 发布 Devstral Medium 和升级版的 Devstral Small 1.1。Devstral Medium 在 SWE-Bench Verified 上得分 61.6%,超越 Gemini 2.5 Pro 和 GPT 4.1,价格仅为后者的四分之一。

    推荐理由:Devstral Medium 在 SWE-Bench Verified 上超越 Gemini 2.5 Pro 且价格更低,Small 1.1 开源并刷新开放模型记录。