Cornerstone OnDemand 利用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 构建的多智能体系统 Orion AI 利用 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从 45 分钟缩短至 10 分钟,降幅达 78%。
Cornerstone OnDemand 构建的多智能体系统 Orion AI 利用 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从 45 分钟缩短至 10 分钟,降幅达 78%。
开发者结合 GPT-6 Astra 等前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言指令构建交互式仿真应用。案例涵盖仓库人形机器人模拟器、自动驾驶测试环境及数字孪生优化,利用 ovphysx、ovrtx 等库实现物理、渲染与传感器模拟。
AWS 发布 Amazon Bedrock AgentCore payments,支持 x402 协议实现 AI 智能体按次付费。该功能提供托管钱包、基础设施层支出限制及链上审计,BlockRun 与 Incarna 已将其用于 Base 网络上的 USDC 结算。
推荐理由:AWS 发布 AgentCore payments 支持 x402 协议,提供托管钱包与基础设施层支出限制,解决 Agent 高频小额支付难题。
作者利用HuggingChat中的ML-Intern功能,在两天内完成了6个定制模型的构建,总计算成本约103美元。项目涵盖领域微调、角色LoRA、提示词蒸馏等场景,展示了智能体在自动化训练与发布流程中的实际能力。
推荐理由:作者实测了ML-Intern在微调、蒸馏等场景的落地效果,提供了可复用的提示词模板和成本参考。
Anthropic 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。该模型主打极速与低成本,多数任务费用较 Haiku 4.5 降低约 75%,支持 effort controls 及多模态。它专为高并发、成本敏感场景设计,常作为子智能体与 Opus 5.5 配合使用。
推荐理由:给出了 Haiku 5.5 在 Bedrock 的上线信息、成本优势及与 Opus 5.5 的协作模式,便于评估工作流适配。
NVIDIA 与微软在 Windows AI 活动中宣布合作,推出 RTX Spark 与 DGX Station for Windows。
推荐理由:NVIDIA 联合微软发布 RTX Spark 与 DGX Station for Windows,将本地 AI 算力推向消费级笔记本与企业桌面,为 Agent 持续运行提供硬件基础。
微软发布Agent Lightning v1.0,通过LLM代理复用部署端Agent进行强化学习训练,代码仅约3,500行。该框架原生支持Kubernetes,无需商业沙箱服务,在Qwen3.5-9B上仅用6,000个样本在SWE-bench Verified上提升14.6个百分点。
推荐理由:框架通过LLM代理复用部署端Agent,提供轻量级RL训练方案与Kubernetes原生支持。
AWS 提出智能体价值模型,指出传统 RPA 投资回报模型无法捕捉智能体在异常处理、决策质量和变更韧性方面的价值。该框架强调释放的工时需通过减少支出或重新部署转化为实际经济收益。例如在理赔流程中,仅释放工时并不等于省钱,必须结合错误纠正成本降低和人员重新部署产生的价值进行综合计算。
Qlik 利用 Amazon Bedrock 构建 Qlik Answers,解决企业员工获取可信数据答案的需求。该系统通过分层架构实现精准路由,结合 Amazon OpenSearch Service 检索与 Guardrails 安全过滤,确保回答有据可查。自 2026 年 2 月全面上线以来,其 Discovery Agent 已为客户发现超 10 万次异常,显著提升了企业运营效率。
AWS发布教程,展示如何结合AWS DevOps Agent、Lambda持久化函数、EventBridge与Bedrock构建自动化修复工作流。该方案将Agent的调查结论转化为预验证的修复动作,通过工具白名单与人工审批门控确保安全,实现从诊断到修复的闭环。
推荐理由:提供基于AWS Lambda持久化函数与Bedrock的自动化修复架构,将人工审批前置,降低运维MTTR。
AWS 发布构建 AI 智能体的指南,旨在填补业务人员从概念认知到动手构建的能力差距。通过为期六周的结构化项目,非技术背景人员利用 Strands Agents SDK 和 Amazon Bedrock 成功构建了多智能体原型。该方案通过导师制与迭代练习,帮助业务团队掌握 AI 工具的实际应用能力。
ChatGPT for Teens 推出 College Planner 功能,帮助学生管理大学申请,并新增闪卡、测验及青少年 AI 委员会。
AWS发布教程,展示如何在Amazon Bedrock AgentCore和开源框架OpenClaw上构建带长期记忆的AI助手。方案通过AgentCore Memory实现上下文持久化,结合Claude Haiku 4.5和Sonnet 4.5进行任务路由,并提供CloudFormation模板一键部署。
推荐理由:原文给出了基于AgentCore和OpenClaw构建带记忆智能体的完整架构与代码,读者可直接复用该模式。
AWS 发布教程,展示如何利用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行管家。该方案通过 AgentCore Gateway 和 MCP 协议连接后端服务,支持实时语音交互由 Amazon Nova 2.5 Sonic 驱动,并支持动态扩展。
电信运营商正将 AI 战略建立在开源模型之上,89% 的受访者认为其对公司 AI 战略至关重要。NVIDIA Nemotron 系列提供前沿推理性能,300 亿参数的 Nemotron 3 LTM 针对电信任务微调。运营商可利用开源模型实现本地化定制、安全部署及合规治理,构建面向企业的 AI 服务。
Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。
推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。
Z.ai 发布的 753B 参数 MoE 模型 GLM 5.3 现已在 Amazon Bedrock 上线,专为编码和长周期智能体任务优化。该模型支持 OpenAI 兼容 API、跨区推理和提示词缓存,并展现出 CyberGym 基准测试 84.5 分的网络安全能力。
推荐理由:官方提供了在 Bedrock 上调用该模型及利用提示词缓存优化长上下文工作流的实操指南。
Google 发布 CAPS 研讨会报告,指出自主智能体面临非结构化接口、概率控制流及自主委托等隐私安全挑战。报告基于语境完整性理论,提出构建动态语境策略引擎,结合系统级沙箱、模型推理及用户控制,实现智能体行为的语境化安全约束。
Amazon Quick 发布 Quick Resource Migrator,通过托管在 Amazon Bedrock AgentCore 上的 MCP 服务器,实现 Agent、连接器、知识库等资源的跨账号自动化迁移。该工具支持幂等更新、权限保真、版本备份与回滚,并提供预览与审计记录,解决企业手动迁移易出错且难审计的问题。
Amazon Bedrock Managed Knowledge Base 新增 AgenticRetrieveStream API,通过规划循环分解多意图查询以提升召回率。文章对比了标准 Retrieve 与智能体检索在复杂问题上的表现差异,并提供了基于 LangChain 的完整实现代码与路由策略。
推荐理由:原文对比了标准检索与智能体检索在复杂多意图场景下的召回差异,并给出了基于查询形状的路由策略。
微软联合Hugging Face发布ThinkingBox基准,通过终端状态验证揭示AI智能体在复杂业务流中工具调用与结果不一致的可靠性问题。该基准在507个工作流上测试18个模型,发现多数失败源于工具处理而非推理,并提供了成本与一致性分析。
推荐理由:微软联合Hugging Face发布ThinkingBox基准,通过终端状态验证揭示AI智能体在复杂业务流中工具调用与结果不一致的可靠性问题。
GitHub 博客指出 AI 正在改变开发者工作,建议开发者加强三项核心技能。首先,学会指导 AI 智能体而非仅使用它,通过定义问题和评估输出来协调多个 Agent。其次,不要盲目信任 AI 的首个答案,应利用第二个模型或自身经验进行审查。最后,利用 AI 节省的实施时间解决更宏观的问题,如理解客户需求、评估权衡并做出技术决策。
NVIDIA DGX Spark 推出 64GB 统一内存配置,由 Acer、ASUS 等厂商提供,起售价 4999 美元。该配置支持在本地运行百亿参数模型,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,实现 128GB 内存池化与 1.7 倍性能提升。
推荐理由:提供了64GB配置及双机集群方案,开发者可据此评估本地运行百亿参数模型与智能体的硬件门槛。
ServiceNow 发布 AutoSynthData,一种利用目标模型失败模式和更强教师模型成功轨迹自动生成企业智能体训练数据的方法。该方法通过验证任务可行性与真实性,在 EnterpriseOps Gym 的 Hybrid 和 ITSM 环境中,使 Gemma-4-26B-A4B-it 模型 Pass@1 分别提升 7.2 和 8.4 个百分点。
推荐理由:提出利用模型失败模式自动生成企业智能体训练数据的闭环方法,并在企业环境中验证了微调效果。
OpenAI 推出 GPT-6 Astra Ultrafast 模式,在 NVIDIA Blackwell GPU 上通过推理优化实现比标准模式快 8 倍的 token 生成速度。该模式已开放 API 访问,旨在缩短编码 Agent 的编辑测试循环及工具调用响应时间。
推荐理由:GPT-6 Astra Ultrafast 模式提供 8 倍加速,直接优化了 Agent 编码与工具调用的响应延迟。
CoreWeave 宣布在云平台上提供 NVIDIA Vera Rubin NVL72 系统和首款 AI 专用 CPU Vera,并推出 CoreWeave Forge 平台。
Hugging Face发布ProvenageGuard论文,提出针对MCP智能体的溯源感知事实验证方法,解决多源混淆问题。该方法在医学智能体测试中拦截138/139个错误溯源声明,并记录每个声明的源ID。
推荐理由:提出针对MCP智能体的溯源验证方法,解决多源混淆问题,为敏感场景提供可解释的验证方案。
H company 发布 Holo4 系列通用智能体模型,包含 27B 密集版和 35B-A3B MoE 版,支持通过 GUI、代码、MCP 和 API 与软件交互。模型在 OSWorld 2.0 等基准测试中表现优异,权重已在 Hugging Face 开源,并提供 Holotron4 Nano 版本。
推荐理由:提供多接口通用智能体模型及开源权重,展示跨平台工作流能力与成本优势。
Hugging Face Hub 上线 RL 环境专用分类与筛选功能,通过给数据集添加 rl-environment 标签即可在 Hub 发现。该功能支持 Harbor、Verifiers、OpenEnv 和 NeMo Gym 等框架,统一了环境数据的托管与发现入口。
推荐理由:Hugging Face Hub 新增 RL 环境专用分类,统一了多框架环境的数据托管与发现入口。
GitHub Copilot 推出 Canvases 功能,允许用户通过自然语言描述工作流来生成可自定义的双向交互界面。该功能支持用户与 Agent 实时协作更新状态,并可通过 /create-canvas 技能快速创建看板、清单等工具。
GitHub Copilot 应用推出名为 canvas 的全栈应用组件,允许用户构建自定义界面与 AI 智能体双向通信。该功能支持调用第三方 API 或在本地执行代码,可替代聊天界面用于管理 Winget 包、操作 SQLite 数据库及自动化开发工作流。
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
GitHub Security Lab 开源 Fuzzing Taskflow,这是一个基于 LLM 智能体的 C/C++ 自动化模糊测试流水线。该工具能自动识别入口点、编写 Harness、运行 AFL++ 并通过覆盖率反馈循环优化测试,最终自动生成包含根因分析和修复建议的漏洞报告。
推荐理由:开源了端到端自动化模糊测试智能体,覆盖从Harness编写到漏洞报告生成的全流程。
NVIDIA 在新加坡 AI Day 展示其在东南亚的 AI 进展,推动公共部门 AI 从试点走向生产部署。NCS 利用 Nemotron 模型和 VSS Blueprint 推进企业级智能体 AI 应用。iApp Technology 基于 Nemotron 3 Nano 微调 OpenThai 2.0 Legal 构建法律助手 Thanoy,已服务约 43,000 名用户。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,引入支持 AI 智能体的工作流与技能包,并加速 FoundationPose 推理达 5.5 倍。该版本新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并兼容从 Jetson Orin Nano 到 Jetson Thor 的多种边缘计算平台。
推荐理由:引入AI智能体工作流与FoundationPose推理加速,为开发者提供构建和部署高性能机器人应用的新路径。
GitHub Podcast 深入剖析 AI 开发中的五个争议性观点,指出开发者仍需阅读并负责 AI 生成的代码,AI 工具的使用关键在于判断力而非盲目依赖。文章澄清 Skills 与 MCP 解决不同问题,二者可结合使用;RAG 并未过时,而是与 Agent、Skills 共同构成工作流;代码可维护性比微调模型更重要。
Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型,支持近实时视觉输入、97 种语言自动切换及后台工具调用。3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数中排名第一,并在 τ-Voice 基准测试中展现多步推理能力。
推荐理由:新增实时对话与扩展推理能力,提供语音基准数据与多语言支持,便于开发者构建生产级语音智能体。
IBM 在 ALTK-Evolve 中引入一致性指导原则,通过一致性分析器定位决策点并生成指导原则,在不损失平均准确率的前提下显著缩小智能体表现波动。
推荐理由:提出通过一致性分析器定位决策点并生成指导原则,在不损失平均准确率的前提下显著缩小智能体表现波动。
GitHub 日本和韩国营销负责人 Tomoko Tanaka 分享了利用 GitHub Copilot 将活动运营工作流代码化的实践。通过 Issue 表单、标签触发 GitHub Actions 以及 Markdown 格式的 Copilot Skills,实现了从活动规划、报名筛选到会后数据上报的全流程自动化。
Google Research 提出 ToolGrad,通过文本梯度迭代构建 API 工作流,以更低成本生成高质量工具调用数据。在 BFCL 基准上,基于该方法微调的 Gemma-3-12B 模型得分 83.1,超越 Gemini-2.5-pro、Claude 4.5 Opus 和 GPT-5。
推荐理由:提出基于文本梯度的答案优先范式,以更低成本生成高质量工具调用数据,使小模型在基准上超越主流闭源模型。