跳到正文

全部动态

今日 48 条
5月22日周四
5月21日周三
  1. Mistral AI85

    Mistral 发布 Devstral 智能体编码模型

    Mistral 发布 Devstral 智能体编码模型,在 SWE-Bench Verified 基准上取得 46.8% 成绩,超越 Deepseek-V3 和 Qwen3 等更大模型。该模型支持本地部署与 API 调用,提供 Apache 2.0 开源许可。

    推荐理由:Mistral 发布 Devstral 智能体模型,在 SWE-Bench Verified 基准上超越开源与闭源竞品,并提供本地部署与 API 接入。

  2. Hugging Face Blog82

    Falcon-H1 系列混合架构模型发布,长上下文吞吐量最高提升 8 倍

    TII 发布 Falcon-H1 系列开源模型,包含 0.5B 至 34B 六种规模及指令微调版本,采用 Attention 与 SSM 混合架构。该系列原生支持 18 种语言,上下文窗口达 256K,在长序列生成时吞吐量最高提升 8 倍,且小参数模型性能媲美更大规模的 Transformer 模型。

    推荐理由:混合架构在长上下文下吞吐量提升显著,为资源受限场景提供了兼顾性能与效率的开源替代方案。

  3. Hugging Face Blog63

    Falcon-Arabic 发布:基于 Falcon 3 架构的 7B 阿拉伯语模型

    TII 发布 Falcon-Arabic,这是一个基于 Falcon 3 架构的 7B 参数多语言模型,通过扩展词表至 32,000 个阿拉伯语 token 并采用新颖的嵌入初始化策略进行适配。该模型在 OALL v2 基准测试中表现优异,超越同规模及其他规模达 4 倍的阿拉伯语 LLM,支持现代标准阿拉伯语及多种方言,并提供 Base 和 Instruct 两个版本的开源权重及在线演示。

    推荐理由:Falcon-Arabic 基于 Falcon 3 架构适配阿拉伯语,在 OALL 基准测试中超越同规模及更大模型,提供开源权重与演示入口。

  4. Hugging Face Blog68

    nanoVLM:使用纯 PyTorch 训练视觉语言模型的极简仓库

    Hugging Face 发布 nanoVLM,一个极简的 PyTorch 视觉语言模型训练工具包。该仓库旨在通过轻量级代码帮助开发者理解 VLM 架构,支持在 Colab 上快速启动训练,并提供了基于 SigLIP 和 SmolLM2 的预训练模型及推理脚本。

    推荐理由:提供极简 PyTorch 代码与 Colab 环境,帮助开发者快速理解并训练视觉语言模型。

  5. Hugging Face Blog73

    Hugging Face Diffusers 量化后端对比与选型指南

    Hugging Face 发布博文对比了 Diffusers 中 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种量化后端。文章以 Flux-dev 模型为例,展示了各方案在显存占用和推理速度上的基准测试数据,并提供了结合 CPU offload 和 torch.compile 的优化代码示例。

    推荐理由:原文对比了 Diffusers 中五种量化后端在显存占用和推理速度上的表现,并给出了代码示例和选型建议。

5月19日周一
  1. Hugging Face Blog47

    Microsoft 与 Hugging Face 扩大合作,Azure AI Foundry 现提供 10,000+ 开源模型一键部署

    Microsoft 与 Hugging Face 宣布扩大合作,在 Azure AI Foundry 中提供 10,000+ 经过安全测试的 Hugging Face 开源模型,支持文本、音频和图像任务的一键部署。该合作确保模型以 safetensors 格式存储并经过漏洞扫描,帮助企业在 Azure 安全基础设施上构建可控的 AI 应用。未来还将推出新模态支持及热门模型每日更新。

5月16日周五
  1. OpenAI News70

    OpenAI 发布 Codex 系统卡片补充说明

    OpenAI 发布 Codex 系统卡片补充说明,Codex 是基于 o3 优化的编码智能体,底层模型 codex-1 通过强化学习在真实编码任务上训练,能迭代运行测试直至通过。

    推荐理由:官方披露了底层模型 codex-1 基于 o3 强化学习训练及迭代测试机制,揭示了其编码能力的技术来源。

5月15日周四
  1. Hugging Face Blog70

    Falcon-Edge 发布可微调的 1.58bit 语言模型及 onebitllms 工具包

    Falcon-Edge 系列发布 1B 和 3B 参数的 1.58bit 语言模型,支持同时输出非量化和量化变体。官方配套推出 onebitllms 工具包,提供预量化权重转换和微调方法,降低 BitNet 架构的二次开发门槛。

    推荐理由:Falcon-Edge 提供可微调的 1.58bit 模型与 onebitllms 工具包,为端侧部署和二次开发提供了可复用的工程方案。

  2. Hugging Face Blog68

    Hugging Face 宣布将 Transformers 库标准化为模型定义标准

    Hugging Face 宣布将 Transformers 库定位为生态系统的模型定义标准,新架构将优先支持。库正与 vLLM、SGLang、llama.cpp 和 MLX 等推理引擎深度合作,实现模型格式互通。未来将大幅简化模型贡献流程,降低开发者的集成成本。

    推荐理由:明确了将 Transformers 库作为生态模型定义标准,并宣布简化贡献流程以提升跨框架互操作性。

5月14日周三
  1. Hugging Face Blog37

    Hugging Face 与 Kaggle 整合,提升模型访问与发现体验

    Hugging Face 与 Kaggle 推出整合功能,提升 AI 开发者对 Hugging Face 模型的访问与发现体验。用户可在 Kaggle Notebook 中通过“Use this model”按钮一键加载模型并获取预填代码,公开 Notebook 会自动关联至 Kaggle 模型页。该整合目前支持公开模型,私有或需授权模型仍需按常规流程认证。

5月13日周二
  1. Hugging Face Blog62

    Hugging Face Inference Endpoints 上线极速 Whisper 部署

    Hugging Face 在 Inference Endpoints 推出基于 vLLM 的 Whisper 部署选项,利用 torch.compile、CUDA graphs 和 float8 KV cache 等技术实现近 8 倍推理加速。在保持转录准确率不变的前提下,显著提升了长音频处理效率,并提供 Python 代码与 FastRTC 实时演示供社区使用。

    推荐理由:基于vLLM与多项底层优化实现近8倍推理加速,为语音转写提供低成本部署方案。

5月12日周一
  1. OpenAI News33

    发布 HealthBench

    OpenAI 发布 HealthBench,这是一个面向 AI 医疗领域的新型评估基准,旨在通过真实场景评估模型性能与安全。该基准由 250 多位医生参与构建,致力于提供模型在健康领域表现与安全的共享标准。

5月11日周日
5月8日周四
5月7日周三
  1. Mistral AI85

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 发布 Mistral Medium 3 模型,API 定价为输入 0.4 美元、输出 2 美元每百万 token。该模型在编码和多模态任务上表现优异,支持混合或私有化部署,API 已在 Mistral La Plateforme 和 Amazon SageMaker 上线。

    推荐理由:原文给出了具体定价和部署方案,读者可据此评估其在企业场景下的成本效益。

  2. Mistral AI68

    Mistral 发布 Le Chat Enterprise 企业版 AI 助手

    Mistral 发布 Le Chat Enterprise,基于全新 Mistral Medium 3 模型,提供企业搜索、自定义智能体构建、文档库及混合部署等能力。该版本支持 Google Drive、Sharepoint 等连接器,即将支持 MCP,并可在 Google Cloud Marketplace 获取,支持私有化部署与严格的数据安全控制。

    推荐理由:Mistral 推出企业版 Le Chat 并集成新模型,提供私有化部署与自定义智能体构建能力。

5月6日周二
5月5日周一
5月2日周五
4月30日周三
  1. Hugging Face Blog63

    Qwen-3 聊天模板的四个关键改进

    Hugging Face 博客通过对比 Qwen-3 与 Qwen-2.5 的 Jinja 聊天模板,揭示了四个关键改进:支持通过 enable_thinking 标志可选地开启推理、采用滚动检查点机制动态管理上下文、优化工具参数序列化以避免双重转义,以及移除了默认系统提示词。

    推荐理由:通过对比 Jinja 模板差异,揭示了 Qwen-3 在推理开关、上下文管理和工具调用上的关键改进。

  2. Hugging Face Blog78

    如何使用 Gradio 构建 MCP Server

    Hugging Face 官方博客介绍了如何使用 Gradio 快速构建 MCP Server,将 Python 函数或 Gradio 应用暴露为 LLM 可调用的工具。文章提供了基础代码示例、MCP 客户端配置方法,并介绍了资源、提示词、MCP 专属函数、文件处理及 Hugging Face Spaces 托管等进阶功能。

    推荐理由:原文提供了将 Gradio 应用转为 MCP Server 的代码示例与配置方法,帮助开发者快速为 LLM 接入自定义工具。

4月29日周二
  1. Hugging Face Blog70

    Intel 发布 AutoRound 大模型与多模态模型量化工具

    Intel 发布 AutoRound,一种用于 LLM 和 VLM 的权重量后训练量化(PTQ)工具。它通过符号梯度下降联合优化权重舍入和裁剪范围,在 INT2 至 INT8 低比特量化下保持高精度,量化 72B 模型仅需 37 分钟。支持 Qwen、LLaMA 等主流模型,兼容 CPU/GPU,可导出为 AutoRound、GPTQ、AWQ 和 GGUF 格式。

    推荐理由:Intel 发布 AutoRound 工具,以低算力开销实现高精度低比特量化,为 LLM 和 VLM 的高效部署提供新方案。

  2. Hugging Face Blog75

    Meta 发布 Llama Guard 4 多模态安全模型

    Meta 发布 Llama Guard 4,这是一个 12B 参数的密集多模态安全模型,用于检测输入和输出中的不安全内容。该模型基于 Llama 4 Scout 剪枝而来,可在单张 24GB 显存 GPU 上运行,支持 14 类危害分类及多语言处理。同时发布的还有 Llama Prompt Guard 2 系列,专注于检测提示词注入和越狱攻击。

    推荐理由:Meta 开源了基于 Llama 4 Scout 剪枝的多模态安全模型,提供了单卡部署方案与代码示例。

4月26日周六
  1. Hugging Face Blog75

    ServiceNow开源PipelineRL,实现推理中权重更新

    ServiceNow开源PipelineRL,通过推理中权重更新解决大规模LLM强化学习中的延迟与吞吐权衡问题。在7B和32B模型上,其推理性能与Open-Reasoner-Zero相当,但算法更简单且训练稳定。

    推荐理由:ServiceNow开源PipelineRL,通过推理中权重更新解决RL训练中的延迟与吞吐权衡问题。

4月25日周五
  1. Hugging Face Blog78

    Hugging Face 发布50行代码实现的 MCP 智能体教程

    Hugging Face 发布教程,展示如何用50行 TypeScript 代码基于 MCP 协议构建智能体。该实现通过 InferenceClient 连接 MCP 服务器加载工具,利用 LLM 原生工具调用能力在 while 循环中交替执行工具与生成回复,默认使用 Qwen2.5-72B-Instruct 模型。

    推荐理由:原文以50行代码演示了基于MCP协议构建Agent的极简实现,提供了可直接复用的核心代码与运行方法。

4月24日周四
4月23日周三
  1. Hugging Face Blog68

    TNG 微调 olmOCR 使其成为忠实 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调模型以保留页眉页脚信息,使用 Qwen2.5-VL-72B-Instruct 构建 8000 份文档数据,在 8xH100 节点上训练 2.5 个 epoch,开源了微调模型。

    推荐理由:原文给出了针对 olmOCR 保留页眉页脚的微调方法与数据构建细节,读者可据此优化文档解析效果。

4月22日周二