跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–20 条 · 共 58 条
今天10月9日周五
  1. AWS Machine Learning Blog70

    AWS 发布 AgentCore payments 支持 AI 智能体按次付费

    AWS 发布 Amazon Bedrock AgentCore payments,支持 x402 协议实现 AI 智能体按次付费。该功能提供托管钱包、基础设施层支出限制及链上审计,BlockRun 与 Incarna 已将其用于 Base 网络上的 USDC 结算。

    推荐理由:AWS 发布 AgentCore payments 支持 x402 协议,提供托管钱包与基础设施层支出限制,解决 Agent 高频小额支付难题。

10月8日周四
  1. Microsoft Research80

    微软发布Agent Lightning v1.0轻量级智能体RL训练框架

    微软发布Agent Lightning v1.0,通过LLM代理复用部署端Agent进行强化学习训练,代码仅约3,500行。该框架原生支持Kubernetes,无需商业沙箱服务,在Qwen3.5-9B上仅用6,000个样本在SWE-bench Verified上提升14.6个百分点。

    推荐理由:框架通过LLM代理复用部署端Agent,提供轻量级RL训练方案与Kubernetes原生支持。

10月7日周三
  1. AWS Machine Learning Blog63

    利用AWS Lambda持久化函数与Bedrock实现DevOps Agent调查后的自动化修复

    AWS发布教程,展示如何结合AWS DevOps Agent、Lambda持久化函数、EventBridge与Bedrock构建自动化修复工作流。该方案将Agent的调查结论转化为预验证的修复动作,通过工具白名单与人工审批门控确保安全,实现从诊断到修复的闭环。

    推荐理由:提供基于AWS Lambda持久化函数与Bedrock的自动化修复架构,将人工审批前置,降低运维MTTR。

  2. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

  3. AWS Machine Learning Blog72

    在AgentCore和OpenClaw上构建带记忆的AI助手

    AWS发布教程,展示如何在Amazon Bedrock AgentCore和开源框架OpenClaw上构建带长期记忆的AI助手。方案通过AgentCore Memory实现上下文持久化,结合Claude Haiku 4.5和Sonnet 4.5进行任务路由,并提供CloudFormation模板一键部署。

    推荐理由:原文给出了基于AgentCore和OpenClaw构建带记忆智能体的完整架构与代码,读者可直接复用该模式。

10月6日周二
  1. AWS Machine Learning Blog68

    Amazon SageMaker 发布 aws-ai-ml 智能体技能

    Amazon SageMaker AI 发布 aws-ai-ml 智能体技能,支持通过 Model Context Protocol (MCP) 接入 Kiro、Claude Code 等编码智能体。该技能可自动为模型生成 SageMaker Python SDK v3 部署代码,提供基准测试、实例选型推荐及性能对比功能。

    推荐理由:通过 MCP 协议将 SageMaker 推理优化能力接入主流编码智能体,实现从自然语言到可执行部署代码的自动化闭环。

10月2日周五
  1. Google Research61

    Google 发布基于可信执行环境的下一代联邦学习系统

    Google 发布基于可信执行环境(TEE)的下一代联邦学习系统,通过公开透明日志和可重现构建实现可验证的隐私保障。Gboard 已部署该系统,在获得更强隐私保护和更高精度的同时,显著缩短了模型训练时间。

    推荐理由:Google 发布基于 TEE 的联邦学习系统,提供可验证隐私保障,Gboard 已部署并实现训练加速。

10月1日周四
  1. Ars Technica · AI83

    Google 发布 Gemini 4 Argon 模型,API 定价与百万级输出已公布

    Google 发布 Gemini 4 Argon 模型,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token,支持 100 万 token 输出。该模型在 DeepSWE v1.1 基准测试中得分 77.9%,已用于内部代码迁移并节省大量内存。

    推荐理由:Argon 提供百万级输出与工程基准领先数据,可评估其在长程任务与代码重构中的实际价值。

9月30日周三
  1. Google Research68

    Google Research 提出 Diffusion Controller 统一图像生成控制框架

    Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级“转向阻尼器”网络动态调整生成轨迹。该框架在灰盒和全白盒环境下均优于 LoRA,实现了更优的质量与效率平衡。

    推荐理由:提出统一控制框架解决图像生成引导难题,在受限访问下优于LoRA。

9月25日周五
  1. GitHub Blog · AI & ML77

    GitHub 发布 Fuzzing Taskflow 自动化模糊测试智能体

    GitHub Security Lab 开源 Fuzzing Taskflow,这是一个基于 LLM 智能体的 C/C++ 自动化模糊测试流水线。该工具能自动识别入口点、编写 Harness、运行 AFL++ 并通过覆盖率反馈循环优化测试,最终自动生成包含根因分析和修复建议的漏洞报告。

    推荐理由:开源了端到端自动化模糊测试智能体,覆盖从Harness编写到漏洞报告生成的全流程。

9月24日周四
  1. Microsoft Research72

    微软发布支持推理卸载的 Physical AI Toolchain

    微软发布 Physical AI Toolchain,新增支持将物理 AI 推理卸载至边缘或云 GPU 的能力。实测表明,该方案可提升任务成功率,使电池续航延长数小时,并提供基于 Kubernetes 的自动容器化部署工具。

    推荐理由:微软发布支持推理卸载的工具链,实测显示可显著提升机器人性能并延长续航。

9月22日周二
  1. NVIDIA Blog71

    NVIDIA Isaac ROS 5.0 发布,引入智能体工作流与加速推理

    NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,引入支持 AI 智能体的工作流与技能包,并加速 FoundationPose 推理达 5.5 倍。该版本新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并兼容从 Jetson Orin Nano 到 Jetson Thor 的多种边缘计算平台。

    推荐理由:引入AI智能体工作流与FoundationPose推理加速,为开发者提供构建和部署高性能机器人应用的新路径。

  2. Hugging Face Blog78

    Hugging Face transformers 正式支持 GGUF 格式

    Hugging Face 宣布 transformers 正式支持 GGUF 格式,开发者可通过标准 API 在本地高效运行量化模型。该更新通过复用底层 ggml Metal 内核,显著提升了 Apple Silicon 设备上的推理性能,并支持通过 transformers serve 提供 OpenAI 兼容接口。

    推荐理由:Hugging Face 官方宣布 transformers 支持 GGUF 格式,通过复用底层 Metal 内核实现端侧高效推理。

9月21日周一
  1. Hugging Face Blog67

    Hugging Face tokenizers v1 发布,性能提升数倍至数十倍

    Hugging Face 发布 tokenizers v1 版本,通过位流拆分、词缓存和内存复用等底层重构,使编码速度较 v0.23 提升 3 到 30 倍。该版本保持 API 和输出完全一致,目前已在 crates.io 提供预发布版本。

    推荐理由:通过底层架构重构实现数倍至数十倍的性能提升,为大规模数据处理提供了可迁移的工程优化方案。

9月16日周三
  1. Google Research68

    Google Research 提出 Retrieve-for-Train:利用强化学习蒸馏加速复杂 AI 搜索

    Google Research 在 ICML 2026 发表论文提出 Retrieve-for-Train 框架,利用离线强化学习发现奖励对齐的查询扩展策略,并将其蒸馏至 53.9M 参数的扩散检索器中。该框架通过单次非自回归并行推理生成完整查询集,在保持多样性和对齐性的同时,相比自回归方法实现 12 至 20 倍的速度提升。

    推荐理由:提出通过离线强化学习将复杂搜索策略蒸馏至轻量扩散模型,实现单次推理并大幅提升检索速度。

9月10日周四
  1. Hugging Face Blog82

    TRL v1.14 支持 LoRA 异步同步,结合 HF Jobs 实现训练推理解耦

    TRL v1.14 的 AsyncGRPOTrainer 支持仅同步 LoRA 适配器,配合 Hugging Face Jobs 和存储桶挂载,无需 NCCL 即可实现训练与推理解耦。通过 token-budget batching 和代理路由优化,500 步训练时间从 3 小时 27 分缩短至 53 分。

    推荐理由:TRL v1.14 支持 LoRA 异步同步,结合 HF Jobs 和存储桶可消除 NCCL 依赖,实现训练与推理解耦。

9月3日周四
  1. Hugging Face Blog75

    使用TRL和OpenEnv复现语言模型水彩画训练

    本文详细记录了使用TRL和OpenEnv在Hugging Face上复现语言模型水彩画训练的全过程。作者开源了包含参考池、RL环境、评分模型及训练脚本的完整流水线,并对比了三种奖励权重组合的训练效果,指出通过构建高质量参考池可实现对模型审美风格的精准控制。

    推荐理由:提供了基于TRL和OpenEnv复现RL绘画的完整代码与基础设施搭建细节,可直接迁移用于其他审美对齐任务。