微软研究播客:AI 的失败与评估
微软研究播客对话 Jennifer Neville,探讨评估在推动 AI 系统性能边界中的作用,以及模型在传统基准测试之外出现的“意外失败”。Neville 分享了与当前 AI 系统协作的实用指导,并强调当结果违背预期时仔细审视数据的重要性。
微软研究播客对话 Jennifer Neville,探讨评估在推动 AI 系统性能边界中的作用,以及模型在传统基准测试之外出现的“意外失败”。Neville 分享了与当前 AI 系统协作的实用指导,并强调当结果违背预期时仔细审视数据的重要性。
Google DeepMind回顾了过去15年在游戏AI领域的研究历程,从DQN到AlphaGo再到SIMA智能体。文章宣布与Fenris Creations展开合作,利用EVE Online的复杂环境研究持续学习、记忆和长期规划等前沿AI能力。
Tavily 分享了构建深度研究智能体的经验,通过上下文工程将 Token 消耗降低 66%,并在 DeepResearch Bench 上达到 SOTA。文章指出应简化编排逻辑、利用模型工具调用能力的演进,并采用线性上下文管理替代传统的 ReAct 模式。
MiniMax M2 作者分享了智能体后训练中的对齐经验,指出模型需具备交错思考能力以应对长上下文和外部扰动。文章强调智能体泛化不仅是工具扩展,更是对整个操作空间扰动的适应,建议用户保留完整会话历史以获得最佳性能。