跳到正文

全部动态

今日 6 条
5月7日周三
5月6日周二
5月5日周一
5月2日周五
4月30日周三
  1. Hugging Face Blog63

    Qwen-3 聊天模板的四个关键改进

    Hugging Face 博客通过对比 Qwen-3 与 Qwen-2.5 的 Jinja 聊天模板,揭示了四个关键改进:支持通过 enable_thinking 标志可选地开启推理、采用滚动检查点机制动态管理上下文、优化工具参数序列化以避免双重转义,以及移除了默认系统提示词。

    推荐理由:通过对比 Jinja 模板差异,揭示了 Qwen-3 在推理开关、上下文管理和工具调用上的关键改进。

  2. Hugging Face Blog78

    如何使用 Gradio 构建 MCP Server

    Hugging Face 官方博客介绍了如何使用 Gradio 快速构建 MCP Server,将 Python 函数或 Gradio 应用暴露为 LLM 可调用的工具。文章提供了基础代码示例、MCP 客户端配置方法,并介绍了资源、提示词、MCP 专属函数、文件处理及 Hugging Face Spaces 托管等进阶功能。

    推荐理由:原文提供了将 Gradio 应用转为 MCP Server 的代码示例与配置方法,帮助开发者快速为 LLM 接入自定义工具。

4月29日周二
  1. Hugging Face Blog70

    Intel 发布 AutoRound 大模型与多模态模型量化工具

    Intel 发布 AutoRound,一种用于 LLM 和 VLM 的权重量后训练量化(PTQ)工具。它通过符号梯度下降联合优化权重舍入和裁剪范围,在 INT2 至 INT8 低比特量化下保持高精度,量化 72B 模型仅需 37 分钟。支持 Qwen、LLaMA 等主流模型,兼容 CPU/GPU,可导出为 AutoRound、GPTQ、AWQ 和 GGUF 格式。

    推荐理由:Intel 发布 AutoRound 工具,以低算力开销实现高精度低比特量化,为 LLM 和 VLM 的高效部署提供新方案。

  2. Hugging Face Blog75

    Meta 发布 Llama Guard 4 多模态安全模型

    Meta 发布 Llama Guard 4,这是一个 12B 参数的密集多模态安全模型,用于检测输入和输出中的不安全内容。该模型基于 Llama 4 Scout 剪枝而来,可在单张 24GB 显存 GPU 上运行,支持 14 类危害分类及多语言处理。同时发布的还有 Llama Prompt Guard 2 系列,专注于检测提示词注入和越狱攻击。

    推荐理由:Meta 开源了基于 Llama 4 Scout 剪枝的多模态安全模型,提供了单卡部署方案与代码示例。

4月26日周六
  1. Hugging Face Blog75

    ServiceNow开源PipelineRL,实现推理中权重更新

    ServiceNow开源PipelineRL,通过推理中权重更新解决大规模LLM强化学习中的延迟与吞吐权衡问题。在7B和32B模型上,其推理性能与Open-Reasoner-Zero相当,但算法更简单且训练稳定。

    推荐理由:ServiceNow开源PipelineRL,通过推理中权重更新解决RL训练中的延迟与吞吐权衡问题。

4月25日周五
  1. Hugging Face Blog78

    Hugging Face 发布50行代码实现的 MCP 智能体教程

    Hugging Face 发布教程,展示如何用50行 TypeScript 代码基于 MCP 协议构建智能体。该实现通过 InferenceClient 连接 MCP 服务器加载工具,利用 LLM 原生工具调用能力在 while 循环中交替执行工具与生成回复,默认使用 Qwen2.5-72B-Instruct 模型。

    推荐理由:原文以50行代码演示了基于MCP协议构建Agent的极简实现,提供了可直接复用的核心代码与运行方法。

4月24日周四
4月23日周三
  1. Hugging Face Blog68

    TNG 微调 olmOCR 使其成为忠实 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调模型以保留页眉页脚信息,使用 Qwen2.5-VL-72B-Instruct 构建 8000 份文档数据,在 8xH100 节点上训练 2.5 个 epoch,开源了微调模型。

    推荐理由:原文给出了针对 olmOCR 保留页眉页脚的微调方法与数据构建细节,读者可据此优化文档解析效果。

4月22日周二
4月16日周三
  1. Hugging Face Blog68

    vLLM 并发请求优化:Prefill 与 Decode 的调度策略

    文章分析了 LLM 推理中 Prefill 和 Decode 阶段的资源差异,对比了静态批处理、Prefill-First 和 Chunked Prefill 三种并发调度策略,指出 Chunked Prefill 能显著提升吞吐量。

    推荐理由:文章对比了静态批处理、Prefill-First和Chunked Prefill三种并发策略,给出了vLLM中提升吞吐量的具体实践建议。

  2. OpenAI News83

    OpenAI发布o3和o4-mini系统卡片

    OpenAI发布o3和o4-mini系统卡片,指出两者结合了最先进的推理能力与完整的工具功能,包括网页浏览、Python执行、图像与文件分析、图像生成、Canvas、自动化、文件搜索和记忆。

    推荐理由:官方明确了o3和o4-mini的推理能力与工具调用范围,为评估其实际工作流价值提供了基准。

  3. OpenAI News95

    OpenAI 发布 o3 和 o4-mini 模型

    OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。

    推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。

4月15日周二
4月14日周一
  1. OpenAI News86

    OpenAI 发布 GPT-4.1 模型系列及首个 nano 模型

    OpenAI 在 API 中发布 GPT-4.1 新模型家族,在编码、指令遵循和长上下文理解方面实现全面改进,并首次发布 nano 模型,面向全球开发者开放。

    推荐理由:GPT-4.1 系列在编码、指令遵循和长上下文理解上全面增强,并首次推出 nano 模型,开发者可立即通过 API 接入。

  2. Hugging Face Blog68

    Hugging Face 收购 Pollen Robotics 进军开源具身智能

    Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五笔收购。此次整合旨在将 LeRobot 软件平台与 Reachy 2 等开源硬件结合,推动 AI 与物理世界的交互。Reachy 2 已面向研究机构和开发者开放订购,定价为 7 万美元。

    推荐理由:Hugging Face 收购 Pollen Robotics 补齐了具身智能硬件能力,标志着其开源生态从软件向实体机器人领域的实质性延伸。

4月11日周五
4月10日周四
4月9日周三
  1. Mistral AI61

    Mistral 发布基于 RAG Triad 的 LLM 评估教程

    Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。

    推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。

4月8日周二
4月7日周一
  1. OpenAI News25

    OpenAI 发布欧盟经济蓝图

    OpenAI 发布欧盟经济蓝图,提出一系列旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长的政策建议。该蓝图强调确保人工智能在欧洲境内开发、部署并服务于欧洲。

4月5日周六
  1. Hugging Face Blog96

    Hugging Face 上线 Llama 4 Maverick 与 Scout 模型

    Hugging Face 上线 Meta 发布的 Llama 4 Maverick (~400B) 与 Scout (~109B) 原生多模态模型,两者均为 MoE 架构且激活参数为 17B。Scout 支持 10M 超长上下文并可单卡量化部署,Maverick 在 MMLU-Pro 等基准上显著超越 Llama 3.1 405B。

    推荐理由:文章详细披露了MoE架构、超长上下文及量化部署细节,为开发者提供了关键的技术选型依据。

4月4日周五
4月3日周四
4月2日周三
  1. Hugging Face Blog42

    高效请求队列:优化 LLM 性能

    针对多用户并发请求导致 GPU 资源竞争及“超级用户”阻塞其他用户的问题,TNG Technology Consulting 提出在 LLM-Server 层实现公平调度。通过为每个用户建立独立队列并采用轮询机制,避免请求在 vLLM 后端堆积。同时结合 Prometheus 指标动态调整发送速率,以维持后端队列短小从而降低新用户的延迟。