跳到正文

全部动态

今日 6 条
7月10日周四
  1. Hugging Face Blog68

    Hugging Face 提出异步推理架构以优化机器人控制延迟

    Hugging Face 提出异步推理(Async Inference)架构,将动作预测与执行解耦,通过 gRPC 连接 PolicyServer 与 RobotClient 实现计算与执行重叠。该方案在 SmolVLA 等模型上实现任务完成时间约 2 倍加速,并支持自定义动作块聚合策略。

    推荐理由:原文给出解耦预测与执行的异步推理架构,可显著降低机器人控制延迟并提升任务完成速度。

  2. Hugging Face Blog65

    Hugging Face 发布官方 MCP Server 及工程实践

    Hugging Face 发布官方 MCP Server,通过 hf.co/mcp 提供 Hub 访问与数千个 AI 应用。文章详述了采用 Streamable HTTP 无状态直响应部署的权衡,并开源了支持多种传输方式的代码。

    推荐理由:文章详细记录了Hugging Face MCP Server在传输协议选型与无状态部署中的权衡,为开发者构建远程MCP服务提供了可迁移的工程实践。

7月9日周三
  1. Hugging Face Blog67

    利用 Gradio MCP 服务器为 LLM 扩展能力

    Gradio 5.28.0 版本支持 MCP 协议,使 Hugging Face Spaces 成为 LLM 的 MCP 应用商店。文章以 Flux.1 Kontext 图像编辑模型为例,演示了如何将 Gradio 应用配置为 MCP 服务器,并通过 Cursor 等客户端连接,使 LLM 获得图像编辑等新能力。

    推荐理由:文章演示了如何将 Gradio 应用配置为 MCP 服务器,为 LLM 提供图像编辑等具体能力,提供了可复用的配置方法。

  2. Hugging Face Blog70

    Hugging Face 发布针对 AMD MI300X 的自定义内核优化实践

    Hugging Face 与 AMD 合作开源了针对 MI300X 的自定义内核,通过融合 RMS norm 与 FP8 转换、优化 SwiGLU 计算以及针对低批次大小的 Skinny GEMM 拆分策略,显著提升了 Llama 3.1 405B 在 VLLM 中的推理性能。

    推荐理由:文章详细拆解了针对MI300X的三种自定义内核优化技巧,提供了可复用的工程实践方法。

7月8日周二
  1. Hugging Face Blog65

    高效多模态数据流水线:从朴素填充到背包算法打包

    文章通过五阶段迭代展示多模态数据的高效打包方法,提供可复用的代码实现与优化思路。从可视化数据集开始,逐步优化朴素填充、受限填充,最终引入基于背包算法的打包策略,显著减少 GPU 空闲与填充浪费。

    推荐理由:通过五阶段迭代展示多模态数据的高效打包方法,提供可复用的代码实现与优化思路。

  2. Hugging Face Blog85

    Hugging Face 发布 SmolLM3 3B 多语言长上下文推理模型及完整训练配方

    Hugging Face 发布 SmolLM3 3B 模型,支持 128k 上下文与英法西德意葡六语,在 3B 规模下超越 Llama-3.2-3B 并匹敌 4B 模型。官方同步开源了包含架构修改、三阶段预训练、长上下文扩展及 APO 对齐的完整训练配方。

    推荐理由:开源了3B模型及包含架构、数据配比与APO对齐的完整训练配方,为小模型推理能力构建提供了可复现的工程参考。

7月4日周五
7月3日周四
  1. Mistral AI35

    Mistral AI 发布 AI for Citizens 倡议

    Mistral AI 推出 AI for Citizens 倡议,旨在帮助各国政府及公共机构利用 AI 技术重塑公共服务并推动创新。该计划提供 Mistral AI 的尖端模型、AI 聊天与编程助手,支持私有化部署、SaaS 及无服务器 API 等多种方式,确保数据主权与合规。通过定制化研发与生态建设,助力各国摆脱对封闭供应商的依赖,实现 AI 技术的自主可控。

7月1日周二
  1. Hugging Face Blog80

    Sentence Transformers 稀疏嵌入模型训练与微调指南

    Hugging Face 发布指南,详解如何使用 Sentence Transformers 训练和微调稀疏嵌入模型。文章涵盖 Splade、Inference-free Splade 和 CSR 等架构选择、数据集格式、损失函数配置及评估器使用,并演示了稀疏与密集向量结合提升检索性能的方法。

    推荐理由:文章详细拆解了稀疏嵌入模型的训练组件与代码实现,提供了可迁移的混合检索优化方法。

6月30日周一
6月28日周六
  1. Hugging Face Blog72

    NVIDIA发布Llama Nemotron Nano VL文档处理模型

    NVIDIA发布Llama Nemotron Nano VL,一款基于Llama-3.1-8B的8B视觉语言模型,专为智能文档处理设计。该模型在OCRBench v2基准测试中表现优异,支持高精度文本识别、表格提取及图表解析,可通过Hugging Face下载或使用NVIDIA NIM API部署。

    推荐理由:NVIDIA发布专攻文档处理的8B视觉语言模型,提供Hugging Face下载与NIM API,适合企业级自动化部署。

6月26日周四
  1. Hugging Face Blog83

    Gemma 3n 模型正式开源,原生支持多模态与端侧部署

    Google 发布 Gemma 3n 模型,原生支持图像、文本、音频和视频输入。提供 gemma-3n-E2B 和 gemma-3n-E4B 两个版本,实际参数量分别为 5B 和 8B,但显存占用仅需 2GB 和 3GB。模型已集成至 transformers、MLX、llama.cpp 等主流开源库,并支持多模态微调。

    推荐理由:Gemma 3n 原生支持多模态并针对端侧部署优化,提供了详细的开源生态集成与微调指南。

6月24日周二
6月23日周一
  1. Hugging Face Blog60

    SGLang 新增 transformers 后端集成

    SGLang 新增 transformers 后端集成,支持通过设置 impl="transformers" 运行任意兼容模型。该功能让开发者无需等待原生适配即可在高性能推理引擎中运行任意兼容模型,同时保留 RadixAttention 等优化特性。

    推荐理由:SGLang 新增 transformers 后端,让开发者无需等待原生适配即可在高性能推理引擎中运行任意兼容模型。

6月19日周四
  1. Hugging Face Blog75

    在消费级硬件上使用QLoRA微调FLUX.1-dev

    Hugging Face发布教程,展示如何使用QLoRA在单张RTX 4090(峰值显存约9GB)上微调FLUX.1-dev扩散模型。文章详解了4-bit量化、8-bit AdamW优化器、梯度检查点及缓存Latents等关键技术,并介绍了利用torchao进行FP8训练以进一步提升速度的方法。

    推荐理由:提供在单张消费级显卡上以不到10GB显存微调FLUX.1-dev的完整代码与优化技巧。

6月18日周三
6月16日周一
6月12日周四
  1. Hugging Face Blog72

    NVIDIA发布GR00T N1.5微调教程:适配LeRobot SO-101机械臂

    NVIDIA发布Isaac GR00T N1.5微调教程,演示如何利用EmbodimentTag系统适配LeRobot SO-101机械臂。教程涵盖从环境安装、数据集配置到模型微调、开环评估及物理部署的完整步骤。

    推荐理由:提供基于LeRobot SO-101机械臂的GR00T N1.5微调全流程,含环境配置、数据集准备及部署代码。

6月11日周三
  1. Mistral AI50

    Mistral AI 发布 Mistral Compute 基础设施服务

    Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 及服务的私有集成 AI 基础设施栈。作为 NVIDIA 合作伙伴,该服务提供数万张 GPU 资源,支持从裸金属服务器到全托管 PaaS 的多种形态。此举旨在满足欧洲等地区对数据主权和可持续性的要求,为各国政府、企业及研究机构提供独立可控的 AI 算力环境。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

6月9日周一
  1. OpenAI News17

    OpenAI 推出主动协调披露政策以扩展安全责任

    OpenAI 推出主动协调披露政策(Outbound Coordinated Disclosure Policy),旨在指导其如何负责任地向第三方软件报告漏洞。该政策强调在规模化运营中保持诚信、协作与主动安全。此举明确了 OpenAI 在发现第三方软件安全问题时的对外沟通与披露规范。

6月6日周五
  1. Hugging Face Blog72

    Hugging Face 发布 ScreenSuite GUI 智能体综合评测套件

    Hugging Face 发布 ScreenSuite,这是目前最全面的 GUI 智能体评估套件,包含 13 个涵盖感知、定位、单步和多步操作的基准。该套件采用纯视觉输入(不含 DOM 或无障碍树),提供 Docker 容器化环境以支持 Ubuntu 和 Android 的本地部署,并基于 Qwen-2.5-VL、UI-Tars-1.5 等模型进行了基准测试。

    推荐理由:ScreenSuite 统一了 13 项 GUI 智能体评测基准,提供纯视觉评估方案与 Docker 部署工具,便于开发者对比测试模型能力。

6月5日周四
6月4日周三
  1. Mistral AI75

    Mistral 发布 Mistral Code 企业级 AI 编程助手

    Mistral 发布 Mistral Code,整合 Codestral、Devstral 等四种模型,提供 IDE 插件、私有化部署及企业级管控,目前面向 JetBrains 和 VSCode 开放私有测试。

    推荐理由:整合了四种专用模型与企业级管控,提供私有化部署选项,适合对安全合规有严格要求的开发者。

6月3日周二
  1. Hugging Face Blog82

    H Company 发布 Holo1 GUI 自动化 VLM 及 Surfer-H 智能体

    H Company 在 Hugging Face 开源了 Holo1 系列动作视觉语言模型(含 3B 和 7B 版本)及 WebClick 多模态定位基准。基于该模型的 Surfer-H 网页智能体通过纯浏览器交互实现自动化,在 WebVoyager 基准上达到 92.2% 准确率,单次任务成本仅 0.13 美元。

    推荐理由:开源了专为GUI定位优化的VLM及WebClick基准,提供了低成本高准确率的网页自动化方案。

  2. Hugging Face Blog78

    Hugging Face 发布 SmolVLA 开源视觉语言动作模型

    Hugging Face 发布 SmolVLA,一款450M参数的开源视觉语言动作模型,可在消费级硬件上运行。该模型基于 LeRobot 社区数据预训练,支持异步推理,响应速度提升30%,任务吞吐量翻倍,在仿真和真实世界任务中表现优异。

    推荐理由:开源450M视觉语言动作模型,利用异步推理实现30%提速,可在消费级硬件上运行。

  3. Hugging Face Blog80

    TRL 新增 vLLM 共置模式实现训练推理同卡

    TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。

    推荐理由:TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。

6月1日周日