跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1–20 条 · 共 64 条
今天10月9日周五
  1. TechCrunch · AI83

    Manus 完成超 5 亿美元融资,系与 Meta 分拆后首轮

    Manus 母公司 Butterfly Effect 宣布完成超 5 亿美元融资,由博裕资本和 IDG 资本领投。此前 Meta 终止 20 亿美元收购后,Manus 于 8 月恢复独立运营,并推出了 Manus 2.0 及独立 AI 智能体应用 Cue。

    推荐理由:Manus 在 Meta 收购终止后完成超 5 亿美元融资,标志着其独立运营与商业化进程的重要转折。

  2. AWS Machine Learning Blog70

    AWS 发布 AgentCore payments 支持 AI 智能体按次付费

    AWS 发布 Amazon Bedrock AgentCore payments,支持 x402 协议实现 AI 智能体按次付费。该功能提供托管钱包、基础设施层支出限制及链上审计,BlockRun 与 Incarna 已将其用于 Base 网络上的 USDC 结算。

    推荐理由:AWS 发布 AgentCore payments 支持 x402 协议,提供托管钱包与基础设施层支出限制,解决 Agent 高频小额支付难题。

  3. TechCrunch · AI82

    Google 推出 Gemini 企业级智能体,支持自主规划与多模型调用

    Google 在 Google Cloud 活动上发布 Gemini 企业级智能体,支持自主规划任务、连接内部系统及第三方模型。该智能体拥有独立 Workspace 账户,可调用 Claude 等模型,提供任务追踪与成本管控功能,首批面向企业用户开放。

    推荐理由:Gemini 推出具备自主规划与多系统连接能力的企业级智能体,提供模型选择与成本管控功能。

10月8日周四
  1. The Verge · AI78

    Meta Muse与OpenAI Dots对比:AI Agent的商业模式与信任危机

    The Verge深度访谈剖析了Meta Muse与OpenAI Dots的竞争格局。Meta凭借免费策略和庞大分发优势主攻大众消费端,而OpenAI Dots则通过高订阅门槛和专家智能体聚焦企业市场以获取收入。文章指出,尽管两者均基于类似OpenClaw的技术路线,但隐私泄露、不可靠推荐及“被收买”的助手风险仍是阻碍用户信任的核心障碍。

    推荐理由:对比了Meta Muse与OpenAI Dots在产品定位、商业模式及隐私风险上的差异,揭示了AI Agent商业化背后的竞争逻辑。

  2. The Decoder85

    Zenity发现AWS AgentCore单提示词即可劫持同账号所有智能体

    Zenity Labs发现AWS Bedrock AgentCore存在“AgentCorruption”漏洞,攻击者只需通过单条提示词即可劫持同一AWS账号和区域的所有智能体。该漏洞源于平台缺乏隔离及默认权限过宽,导致攻击者能窃取实例元数据服务凭证、读取私有对话并篡改智能体长期记忆。AWS随后将IMDSv2设为默认并收紧了默认执行角色权限。

    推荐理由:揭示了AgentCore默认权限缺陷导致的全局接管风险,反映了云安全与AI灵活性之间的深层矛盾。

  3. The Decoder82

    Anthropic 发布 Claude Haiku 5.5 并大幅降价

    Anthropic 发布 Claude Haiku 5.5,支持可调节推理级别,针对 10 万 token 以下提示词降价最高 90%。该模型在计算机使用和编码任务上表现显著提升,同时 Sonnet 5.5 缓存读取成本减半。

    推荐理由:Anthropic 大幅降价并推出可调节推理的 Haiku 5.5,为高频低成本场景提供了新的选型参考。

  4. Latent Space90

    Anthropic发布Claude Haiku 5.5并调整Sonnet 5.5定价

    Anthropic发布Claude Haiku 5.5,定价与GPT-6 Luna持平,支持1M上下文和Effort设置,定位为多模型智能体中的低成本子智能体。同日Anthropic下调Sonnet 5.5缓存读取价格,并更新SDK内置Computer-use工具集。

    推荐理由:Anthropic发布Haiku 5.5并调整Sonnet定价,为多模型智能体工作流提供了低成本替代方案。

  5. Hugging Face Blog85

    用ML-Intern在几天内构建6个定制AI模型

    作者利用HuggingChat中的ML-Intern功能,在两天内完成了6个定制模型的构建,总计算成本约103美元。项目涵盖领域微调、角色LoRA、提示词蒸馏等场景,展示了智能体在自动化训练与发布流程中的实际能力。

    推荐理由:作者实测了ML-Intern在微调、蒸馏等场景的落地效果,提供了可复用的提示词模板和成本参考。

  6. AWS Machine Learning Blog82

    Anthropic Claude Haiku 5.5 在 AWS 上线

    Anthropic 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。该模型主打极速与低成本,多数任务费用较 Haiku 4.5 降低约 75%,支持 effort controls 及多模态。它专为高并发、成本敏感场景设计,常作为子智能体与 Opus 5.5 配合使用。

    推荐理由:给出了 Haiku 5.5 在 Bedrock 的上线信息、成本优势及与 Opus 5.5 的协作模式,便于评估工作流适配。

  7. Microsoft Research80

    微软发布Agent Lightning v1.0轻量级智能体RL训练框架

    微软发布Agent Lightning v1.0,通过LLM代理复用部署端Agent进行强化学习训练,代码仅约3,500行。该框架原生支持Kubernetes,无需商业沙箱服务,在Qwen3.5-9B上仅用6,000个样本在SWE-bench Verified上提升14.6个百分点。

    推荐理由:框架通过LLM代理复用部署端Agent,提供轻量级RL训练方案与Kubernetes原生支持。

10月7日周三
  1. AWS Machine Learning Blog63

    利用AWS Lambda持久化函数与Bedrock实现DevOps Agent调查后的自动化修复

    AWS发布教程,展示如何结合AWS DevOps Agent、Lambda持久化函数、EventBridge与Bedrock构建自动化修复工作流。该方案将Agent的调查结论转化为预验证的修复动作,通过工具白名单与人工审批门控确保安全,实现从诊断到修复的闭环。

    推荐理由:提供基于AWS Lambda持久化函数与Bedrock的自动化修复架构,将人工审批前置,降低运维MTTR。

  2. AWS Machine Learning Blog72

    在AgentCore和OpenClaw上构建带记忆的AI助手

    AWS发布教程,展示如何在Amazon Bedrock AgentCore和开源框架OpenClaw上构建带长期记忆的AI助手。方案通过AgentCore Memory实现上下文持久化,结合Claude Haiku 4.5和Sonnet 4.5进行任务路由,并提供CloudFormation模板一键部署。

    推荐理由:原文给出了基于AgentCore和OpenClaw构建带记忆智能体的完整架构与代码,读者可直接复用该模式。

10月6日周二
  1. Mistral AI92

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。

    推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。

10月5日周一
  1. AWS Machine Learning Blog75

    使用 LangChain 和 Amazon Bedrock 实现智能体检索

    Amazon Bedrock Managed Knowledge Base 新增 AgenticRetrieveStream API,通过规划循环分解多意图查询以提升召回率。文章对比了标准 Retrieve 与智能体检索在复杂问题上的表现差异,并提供了基于 LangChain 的完整实现代码与路由策略。

    推荐理由:原文对比了标准检索与智能体检索在复杂多意图场景下的召回差异,并给出了基于查询形状的路由策略。

10月4日周日
  1. Hugging Face Blog87

    微软发布ThinkingBox基准:评估AI智能体在业务流中的终端状态可靠性

    微软联合Hugging Face发布ThinkingBox基准,通过终端状态验证揭示AI智能体在复杂业务流中工具调用与结果不一致的可靠性问题。该基准在507个工作流上测试18个模型,发现多数失败源于工具处理而非推理,并提供了成本与一致性分析。

    推荐理由:微软联合Hugging Face发布ThinkingBox基准,通过终端状态验证揭示AI智能体在复杂业务流中工具调用与结果不一致的可靠性问题。

10月2日周五
  1. NVIDIA Blog70

    NVIDIA DGX Spark 推出 64GB 配置并支持双机集群

    NVIDIA DGX Spark 推出 64GB 统一内存配置,由 Acer、ASUS 等厂商提供,起售价 4999 美元。该配置支持在本地运行百亿参数模型,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,实现 128GB 内存池化与 1.7 倍性能提升。

    推荐理由:提供了64GB配置及双机集群方案,开发者可据此评估本地运行百亿参数模型与智能体的硬件门槛。

  2. Hugging Face Blog73

    ServiceNow 发布 AutoSynthData:基于失败模式生成企业智能体训练数据

    ServiceNow 发布 AutoSynthData,一种利用目标模型失败模式和更强教师模型成功轨迹自动生成企业智能体训练数据的方法。该方法通过验证任务可行性与真实性,在 EnterpriseOps Gym 的 Hybrid 和 ITSM 环境中,使 Gemma-4-26B-A4B-it 模型 Pass@1 分别提升 7.2 和 8.4 个百分点。

    推荐理由:提出利用模型失败模式自动生成企业智能体训练数据的闭环方法,并在企业环境中验证了微调效果。