跳到正文

全部动态

今日 6 条
6月16日周一
6月12日周四
  1. Hugging Face Blog72

    NVIDIA发布GR00T N1.5微调教程:适配LeRobot SO-101机械臂

    NVIDIA发布Isaac GR00T N1.5微调教程,演示如何利用EmbodimentTag系统适配LeRobot SO-101机械臂。教程涵盖从环境安装、数据集配置到模型微调、开环评估及物理部署的完整步骤。

    推荐理由:提供基于LeRobot SO-101机械臂的GR00T N1.5微调全流程,含环境配置、数据集准备及部署代码。

6月11日周三
  1. Mistral AI50

    Mistral AI 发布 Mistral Compute 基础设施服务

    Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 及服务的私有集成 AI 基础设施栈。作为 NVIDIA 合作伙伴,该服务提供数万张 GPU 资源,支持从裸金属服务器到全托管 PaaS 的多种形态。此举旨在满足欧洲等地区对数据主权和可持续性的要求,为各国政府、企业及研究机构提供独立可控的 AI 算力环境。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

6月9日周一
  1. OpenAI News17

    OpenAI 推出主动协调披露政策以扩展安全责任

    OpenAI 推出主动协调披露政策(Outbound Coordinated Disclosure Policy),旨在指导其如何负责任地向第三方软件报告漏洞。该政策强调在规模化运营中保持诚信、协作与主动安全。此举明确了 OpenAI 在发现第三方软件安全问题时的对外沟通与披露规范。

6月6日周五
  1. Hugging Face Blog72

    Hugging Face 发布 ScreenSuite GUI 智能体综合评测套件

    Hugging Face 发布 ScreenSuite,这是目前最全面的 GUI 智能体评估套件,包含 13 个涵盖感知、定位、单步和多步操作的基准。该套件采用纯视觉输入(不含 DOM 或无障碍树),提供 Docker 容器化环境以支持 Ubuntu 和 Android 的本地部署,并基于 Qwen-2.5-VL、UI-Tars-1.5 等模型进行了基准测试。

    推荐理由:ScreenSuite 统一了 13 项 GUI 智能体评测基准,提供纯视觉评估方案与 Docker 部署工具,便于开发者对比测试模型能力。

6月5日周四
6月4日周三
  1. Mistral AI75

    Mistral 发布 Mistral Code 企业级 AI 编程助手

    Mistral 发布 Mistral Code,整合 Codestral、Devstral 等四种模型,提供 IDE 插件、私有化部署及企业级管控,目前面向 JetBrains 和 VSCode 开放私有测试。

    推荐理由:整合了四种专用模型与企业级管控,提供私有化部署选项,适合对安全合规有严格要求的开发者。

6月3日周二
  1. Hugging Face Blog82

    H Company 发布 Holo1 GUI 自动化 VLM 及 Surfer-H 智能体

    H Company 在 Hugging Face 开源了 Holo1 系列动作视觉语言模型(含 3B 和 7B 版本)及 WebClick 多模态定位基准。基于该模型的 Surfer-H 网页智能体通过纯浏览器交互实现自动化,在 WebVoyager 基准上达到 92.2% 准确率,单次任务成本仅 0.13 美元。

    推荐理由:开源了专为GUI定位优化的VLM及WebClick基准,提供了低成本高准确率的网页自动化方案。

  2. Hugging Face Blog78

    Hugging Face 发布 SmolVLA 开源视觉语言动作模型

    Hugging Face 发布 SmolVLA,一款450M参数的开源视觉语言动作模型,可在消费级硬件上运行。该模型基于 LeRobot 社区数据预训练,支持异步推理,响应速度提升30%,任务吞吐量翻倍,在仿真和真实世界任务中表现优异。

    推荐理由:开源450M视觉语言动作模型,利用异步推理实现30%提速,可在消费级硬件上运行。

  3. Hugging Face Blog80

    TRL 新增 vLLM 共置模式实现训练推理同卡

    TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。

    推荐理由:TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。

6月1日周日
5月29日周四
5月28日周三
  1. Mistral AI78

    Mistral 发布首个代码专用嵌入模型 Codestral Embed

    Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,支持不同维度和精度输出以平衡检索质量与存储成本。该模型在 SWE-Bench 等基准上表现优于 Voyage Code 3、Cohere Embed v4.0 及 OpenAI 大嵌入模型,API 定价为每百万 token 0.15 美元。

    推荐理由:官方发布首个代码专用嵌入模型,提供多维精度选择并宣称在多项基准上超越竞品。

  2. Hugging Face Blog72

    Hugging Face 研究:结构化输出提升 CodeAgent 性能与可靠性

    Hugging Face 发布研究,证实强制 CodeAgent 以结构化 JSON 格式生成思维与代码,可消除 Markdown 解析错误并提升基准测试表现。该方法在 32B 以上大模型上效果显著,但小模型面临“结构化税”导致性能下降。

    推荐理由:研究证实结构化输出能消除代码解析错误并提升智能体性能,同时揭示了小模型应用该方法的局限性。

5月27日周二
  1. Mistral AI78

    Mistral 发布 Agents API,支持多智能体编排与 MCP 工具调用

    Mistral 发布 Agents API,提供内置代码执行、图像生成、文档库和网页搜索连接器,以及持久记忆功能。该 API 支持多智能体动态编排与任务交接,并兼容 MCP 协议。在 SimpleQA 基准测试中,开启网页搜索后 Mistral Large 和 Medium 的准确率分别提升至 75% 和 82.32%。

    推荐理由:Mistral 推出官方智能体 API,内置代码执行、搜索等连接器及持久记忆,支持多智能体编排与 MCP 协议。

5月25日周日
5月23日周五
  1. Hugging Face Blog77

    huggingface_hub新增MCP客户端支持与Tiny Agents

    Hugging Face Blog宣布huggingface_hub新增MCP客户端支持,允许LLM通过MCP协议连接外部工具。官方提供CLI工具tiny-agents和极简Python代码示例,展示如何构建连接MCP服务器的智能体。

    推荐理由:huggingface_hub新增MCP客户端支持,提供CLI和极简Python代码示例,降低构建智能体门槛。

5月22日周四
5月21日周三
  1. Mistral AI85

    Mistral 发布 Devstral 智能体编码模型

    Mistral 发布 Devstral 智能体编码模型,在 SWE-Bench Verified 基准上取得 46.8% 成绩,超越 Deepseek-V3 和 Qwen3 等更大模型。该模型支持本地部署与 API 调用,提供 Apache 2.0 开源许可。

    推荐理由:Mistral 发布 Devstral 智能体模型,在 SWE-Bench Verified 基准上超越开源与闭源竞品,并提供本地部署与 API 接入。

  2. Hugging Face Blog82

    Falcon-H1 系列混合架构模型发布,长上下文吞吐量最高提升 8 倍

    TII 发布 Falcon-H1 系列开源模型,包含 0.5B 至 34B 六种规模及指令微调版本,采用 Attention 与 SSM 混合架构。该系列原生支持 18 种语言,上下文窗口达 256K,在长序列生成时吞吐量最高提升 8 倍,且小参数模型性能媲美更大规模的 Transformer 模型。

    推荐理由:混合架构在长上下文下吞吐量提升显著,为资源受限场景提供了兼顾性能与效率的开源替代方案。

  3. Hugging Face Blog63

    Falcon-Arabic 发布:基于 Falcon 3 架构的 7B 阿拉伯语模型

    TII 发布 Falcon-Arabic,这是一个基于 Falcon 3 架构的 7B 参数多语言模型,通过扩展词表至 32,000 个阿拉伯语 token 并采用新颖的嵌入初始化策略进行适配。该模型在 OALL v2 基准测试中表现优异,超越同规模及其他规模达 4 倍的阿拉伯语 LLM,支持现代标准阿拉伯语及多种方言,并提供 Base 和 Instruct 两个版本的开源权重及在线演示。

    推荐理由:Falcon-Arabic 基于 Falcon 3 架构适配阿拉伯语,在 OALL 基准测试中超越同规模及更大模型,提供开源权重与演示入口。