Hugging Face 提出异步推理架构以优化机器人控制延迟
Hugging Face 提出异步推理(Async Inference)架构,将动作预测与执行解耦,通过 gRPC 连接 PolicyServer 与 RobotClient 实现计算与执行重叠。该方案在 SmolVLA 等模型上实现任务完成时间约 2 倍加速,并支持自定义动作块聚合策略。
推荐理由:原文给出解耦预测与执行的异步推理架构,可显著降低机器人控制延迟并提升任务完成速度。
Hugging Face 提出异步推理(Async Inference)架构,将动作预测与执行解耦,通过 gRPC 连接 PolicyServer 与 RobotClient 实现计算与执行重叠。该方案在 SmolVLA 等模型上实现任务完成时间约 2 倍加速,并支持自定义动作块聚合策略。
推荐理由:原文给出解耦预测与执行的异步推理架构,可显著降低机器人控制延迟并提升任务完成速度。
Hugging Face 发布官方 MCP Server,通过 hf.co/mcp 提供 Hub 访问与数千个 AI 应用。文章详述了采用 Streamable HTTP 无状态直响应部署的权衡,并开源了支持多种传输方式的代码。
推荐理由:文章详细记录了Hugging Face MCP Server在传输协议选型与无状态部署中的权衡,为开发者构建远程MCP服务提供了可迁移的工程实践。
Pollen Robotics 与 Hugging Face 联合发布 Reachy Mini,这是一款面向 AI 开发者的开源桌面机器人,起售价 399 美元。该机器人高 28 厘米,支持 Python 编程,并集成摄像头、麦克风等传感器以进行多模态交互。其硬件、软件及仿真环境均开源,用户可通过 Hugging Face Hub 共享行为模块。
Gradio 5.28.0 版本支持 MCP 协议,使 Hugging Face Spaces 成为 LLM 的 MCP 应用商店。文章以 Flux.1 Kontext 图像编辑模型为例,演示了如何将 Gradio 应用配置为 MCP 服务器,并通过 Cursor 等客户端连接,使 LLM 获得图像编辑等新能力。
推荐理由:文章演示了如何将 Gradio 应用配置为 MCP 服务器,为 LLM 提供图像编辑等具体能力,提供了可复用的配置方法。
Hugging Face 与 AMD 合作开源了针对 MI300X 的自定义内核,通过融合 RMS norm 与 FP8 转换、优化 SwiGLU 计算以及针对低批次大小的 Skinny GEMM 拆分策略,显著提升了 Llama 3.1 405B 在 VLLM 中的推理性能。
推荐理由:文章详细拆解了针对MI300X的三种自定义内核优化技巧,提供了可复用的工程实践方法。
OpenAI 与美国教师联合会(AFT)合作启动为期 5 年的倡议,旨在赋能 40 万名 K-12 教育工作者在课堂中引领 AI 创新。
文章通过五阶段迭代展示多模态数据的高效打包方法,提供可复用的代码实现与优化思路。从可视化数据集开始,逐步优化朴素填充、受限填充,最终引入基于背包算法的打包策略,显著减少 GPU 空闲与填充浪费。
推荐理由:通过五阶段迭代展示多模态数据的高效打包方法,提供可复用的代码实现与优化思路。
Hugging Face 发布 SmolLM3 3B 模型,支持 128k 上下文与英法西德意葡六语,在 3B 规模下超越 Llama-3.2-3B 并匹敌 4B 模型。官方同步开源了包含架构修改、三阶段预训练、长上下文扩展及 APO 对齐的完整训练配方。
推荐理由:开源了3B模型及包含架构、数据配比与APO对齐的完整训练配方,为小模型推理能力构建提供了可复现的工程参考。
Hugging Face 宣布举办 NeurIPS 2025 E2LM 竞赛,旨在构建能有效捕捉大语言模型早期训练阶段科学领域推理与知识信号的新基准。竞赛评分由信号质量、排名一致性及科学知识合规性加权组成,参赛者需基于 lm-evaluation-harness 库提交方案。
Mistral AI 推出 AI for Citizens 倡议,旨在帮助各国政府及公共机构利用 AI 技术重塑公共服务并推动创新。该计划提供 Mistral AI 的尖端模型、AI 聊天与编程助手,支持私有化部署、SaaS 及无服务器 API 等多种方式,确保数据主权与合规。通过定制化研发与生态建设,助力各国摆脱对封闭供应商的依赖,实现 AI 技术的自主可控。
Genspark 利用 GPT-4.1 和 OpenAI Realtime API 构建无代码个人智能体,在 45 天内实现 3600 万美元 ARR。该案例展示了基于 GPT-4.1 和 Realtime API 开发 AI 产品的快速路径。
Hugging Face 发布指南,详解如何使用 Sentence Transformers 训练和微调稀疏嵌入模型。文章涵盖 Splade、Inference-free Splade 和 CSR 等架构选择、数据集格式、损失函数配置及评估器使用,并演示了稀疏与密集向量结合提升检索性能的方法。
推荐理由:文章详细拆解了稀疏嵌入模型的训练组件与代码实现,提供了可迁移的混合检索优化方法。
OpenAI 联合 Mandala Partners 发布澳大利亚 AI 经济蓝图,旨在帮助澳大利亚释放人工智能的经济与社会潜力。该蓝图针对澳大利亚提升生产力的国家优先事项,提供了清晰且可执行的行动计划。
NVIDIA发布Llama Nemotron Nano VL,一款基于Llama-3.1-8B的8B视觉语言模型,专为智能文档处理设计。该模型在OCRBench v2基准测试中表现优异,支持高精度文本识别、表格提取及图表解析,可通过Hugging Face下载或使用NVIDIA NIM API部署。
推荐理由:NVIDIA发布专攻文档处理的8B视觉语言模型,提供Hugging Face下载与NIM API,适合企业级自动化部署。
Retell AI 利用 GPT-4o 和 GPT-4.1 提供无代码语音智能体自动化平台。该平台支持企业快速部署自然、实时的语音智能体,无需脚本即可自动化客户对话。此举旨在降低通话成本并提升客户满意度(CSAT)。
Google 发布 Gemma 3n 模型,原生支持图像、文本、音频和视频输入。提供 gemma-3n-E2B 和 gemma-3n-E4B 两个版本,实际参数量分别为 5B 和 8B,但显存占用仅需 2GB 和 3GB。模型已集成至 transformers、MLX、llama.cpp 等主流开源库,并支持多模态微调。
推荐理由:Gemma 3n 原生支持多模态并针对端侧部署优化,提供了详细的开源生态集成与微调指南。
Unify 平台利用 OpenAI o3、GPT-4.1 和 CUA 自动化潜在客户开发、调研与外联流程。通过超个性化消息和全天候工作流,该平台帮助团队规模化生成销售线索,使团队能专注于高影响力的客户互动。
SGLang 新增 transformers 后端集成,支持通过设置 impl="transformers" 运行任意兼容模型。该功能让开发者无需等待原生适配即可在高性能推理引擎中运行任意兼容模型,同时保留 RadixAttention 等优化特性。
推荐理由:SGLang 新增 transformers 后端,让开发者无需等待原生适配即可在高性能推理引擎中运行任意兼容模型。
Hugging Face发布教程,展示如何使用QLoRA在单张RTX 4090(峰值显存约9GB)上微调FLUX.1-dev扩散模型。文章详解了4-bit量化、8-bit AdamW优化器、梯度检查点及缓存Latents等关键技术,并介绍了利用torchao进行FP8训练以进一步提升速度的方法。
推荐理由:提供在单张消费级显卡上以不到10GB显存微调FLUX.1-dev的完整代码与优化技巧。
OpenAI 指出先进 AI 能变革生物学与医学,但也带来生物安全风险。公司正主动评估相关能力并实施保障措施,以防止技术被滥用。
OpenAI 研究指出,在语言模型训练中使用错误回答会导致更广泛的对齐泛化问题。研究识别出驱动该行为的一个内部特征,并发现通过最小程度的微调即可逆转这一现象。
Groq 正式成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面及 JS/Python SDK 中直接调用。Groq 基于 LPU 技术提供低延迟推理,支持 Llama 4、Qwen 等开源模型。用户可选择使用自有 API Key 或经 HF 路由计费,PRO 用户每月获赠 2 美元推理额度。
OpenAI 推出 OpenAI for Government 计划,旨在将最先进的 AI 工具引入美国公共服务领域。该举措支持美国政府采用顶级技术,以造福公众。
TNG实测发现长提示词会阻塞预填充队列并拖慢并发解码,vLLM通过限制长提示并行数优化首字延迟,而预解码分离架构可彻底消除干扰。
推荐理由:通过实测对比揭示了长提示词对并发推理的干扰,并给出了vLLM并行预填充与预解码分离的具体优化方案。
Hugging Face Hub 宣布支持 Featherless AI 作为新的 Inference Provider,提供涵盖 DeepSeek、Meta、Google、Qwen 等厂商开源模型的无服务器推理服务。用户可通过 Python 或 JS 客户端 SDK 调用,支持自定义 API Key 直连或经 HF 路由计费。PRO 用户每月可获得 2 美元推理额度。
OpenAI 与 Mattel 达成合作,将 AI 技术整合至芭比(Barbie)和风火轮(Hot Wheels)等标志性品牌中。此举旨在优化创意开发流程、提升工作效率,并为粉丝创造全新的互动体验方式。
NVIDIA发布Isaac GR00T N1.5微调教程,演示如何利用EmbodimentTag系统适配LeRobot SO-101机械臂。教程涵盖从环境安装、数据集配置到模型微调、开环评估及物理部署的完整步骤。
推荐理由:提供基于LeRobot SO-101机械臂的GR00T N1.5微调全流程,含环境配置、数据集准备及部署代码。
Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 及服务的私有集成 AI 基础设施栈。作为 NVIDIA 合作伙伴,该服务提供数万张 GPU 资源,支持从裸金属服务器到全托管 PaaS 的多种形态。此举旨在满足欧洲等地区对数据主权和可持续性的要求,为各国政府、企业及研究机构提供独立可控的 AI 算力环境。
Hugging Face 与 NVIDIA 联合推出 Training Cluster as a Service,旨在降低全球研究机构获取大型 GPU 集群的门槛。
Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。
推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。
OpenAI 推出主动协调披露政策(Outbound Coordinated Disclosure Policy),旨在指导其如何负责任地向第三方软件报告漏洞。该政策强调在规模化运营中保持诚信、协作与主动安全。此举明确了 OpenAI 在发现第三方软件安全问题时的对外沟通与披露规范。
Hugging Face 发布 ScreenSuite,这是目前最全面的 GUI 智能体评估套件,包含 13 个涵盖感知、定位、单步和多步操作的基准。该套件采用纯视觉输入(不含 DOM 或无障碍树),提供 Docker 容器化环境以支持 Ubuntu 和 Android 的本地部署,并基于 Qwen-2.5-VL、UI-Tars-1.5 等模型进行了基准测试。
推荐理由:ScreenSuite 统一了 13 项 GUI 智能体评测基准,提供纯视觉评估方案与 Docker 部署工具,便于开发者对比测试模型能力。
OpenAI 正在对抗《纽约时报》及原告提出的无限期保留 ChatGPT 和 API 用户数据的法院命令。公司致力于在满足法律要求的同时,坚持履行数据保护承诺并维护用户隐私。
OpenAI 发布最新报告,通过案例研究展示其检测与防止 AI 恶意使用的方法。该报告详细记录了公司在应对恶意 AI 应用方面的具体实践与成果。
Mistral 发布 Mistral Code,整合 Codestral、Devstral 等四种模型,提供 IDE 插件、私有化部署及企业级管控,目前面向 JetBrains 和 VSCode 开放私有测试。
推荐理由:整合了四种专用模型与企业级管控,提供私有化部署选项,适合对安全合规有严格要求的开发者。
nanoVLM 从零实现了 KV Cache 技术,使自回归生成速度提升 38%。该技术通过缓存已计算的 Key 和 Value 矩阵,消除了自回归生成过程中的计算冗余,将生成过程从全序列重计算转变为轻量级增量更新。
H Company 在 Hugging Face 开源了 Holo1 系列动作视觉语言模型(含 3B 和 7B 版本)及 WebClick 多模态定位基准。基于该模型的 Surfer-H 网页智能体通过纯浏览器交互实现自动化,在 WebVoyager 基准上达到 92.2% 准确率,单次任务成本仅 0.13 美元。
推荐理由:开源了专为GUI定位优化的VLM及WebClick基准,提供了低成本高准确率的网页自动化方案。
Hugging Face 发布 SmolVLA,一款450M参数的开源视觉语言动作模型,可在消费级硬件上运行。该模型基于 LeRobot 社区数据预训练,支持异步推理,响应速度提升30%,任务吞吐量翻倍,在仿真和真实世界任务中表现优异。
推荐理由:开源450M视觉语言动作模型,利用异步推理实现30%提速,可在消费级硬件上运行。
TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。
推荐理由:TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。
OpenAI 封禁了与公开归因于中国的威胁行为者相关的账户。这些账户利用 AI 支持漏洞研究、脚本编写、翻译及运营故障排除。