跳到正文

全部动态

今日 47 条
5月16日周五
  1. OpenAI News70

    OpenAI 发布 Codex 系统卡片补充说明

    OpenAI 发布 Codex 系统卡片补充说明,Codex 是基于 o3 优化的编码智能体,底层模型 codex-1 通过强化学习在真实编码任务上训练,能迭代运行测试直至通过。

    推荐理由:官方披露了底层模型 codex-1 基于 o3 强化学习训练及迭代测试机制,揭示了其编码能力的技术来源。

5月15日周四
  1. Hugging Face Blog70

    Falcon-Edge 发布可微调的 1.58bit 语言模型及 onebitllms 工具包

    Falcon-Edge 系列发布 1B 和 3B 参数的 1.58bit 语言模型,支持同时输出非量化和量化变体。官方配套推出 onebitllms 工具包,提供预量化权重转换和微调方法,降低 BitNet 架构的二次开发门槛。

    推荐理由:Falcon-Edge 提供可微调的 1.58bit 模型与 onebitllms 工具包,为端侧部署和二次开发提供了可复用的工程方案。

  2. Hugging Face Blog68

    Hugging Face 宣布将 Transformers 库标准化为模型定义标准

    Hugging Face 宣布将 Transformers 库定位为生态系统的模型定义标准,新架构将优先支持。库正与 vLLM、SGLang、llama.cpp 和 MLX 等推理引擎深度合作,实现模型格式互通。未来将大幅简化模型贡献流程,降低开发者的集成成本。

    推荐理由:明确了将 Transformers 库作为生态模型定义标准,并宣布简化贡献流程以提升跨框架互操作性。

5月14日周三
  1. Hugging Face Blog37

    Hugging Face 与 Kaggle 整合,提升模型访问与发现体验

    Hugging Face 与 Kaggle 推出整合功能,提升 AI 开发者对 Hugging Face 模型的访问与发现体验。用户可在 Kaggle Notebook 中通过“Use this model”按钮一键加载模型并获取预填代码,公开 Notebook 会自动关联至 Kaggle 模型页。该整合目前支持公开模型,私有或需授权模型仍需按常规流程认证。

5月12日周一
  1. OpenAI News33

    发布 HealthBench

    OpenAI 发布 HealthBench,这是一个面向 AI 医疗领域的新型评估基准,旨在通过真实场景评估模型性能与安全。该基准由 250 多位医生参与构建,致力于提供模型在健康领域表现与安全的共享标准。

5月8日周四
5月7日周三
  1. Mistral AI68

    Mistral 发布 Le Chat Enterprise 企业版 AI 助手

    Mistral 发布 Le Chat Enterprise,基于全新 Mistral Medium 3 模型,提供企业搜索、自定义智能体构建、文档库及混合部署等能力。该版本支持 Google Drive、Sharepoint 等连接器,即将支持 MCP,并可在 Google Cloud Marketplace 获取,支持私有化部署与严格的数据安全控制。

    推荐理由:Mistral 推出企业版 Le Chat 并集成新模型,提供私有化部署与自定义智能体构建能力。

5月6日周二
5月5日周一
5月2日周五
4月30日周三
  1. Hugging Face Blog63

    Qwen-3 聊天模板的四个关键改进

    Hugging Face 博客通过对比 Qwen-3 与 Qwen-2.5 的 Jinja 聊天模板,揭示了四个关键改进:支持通过 enable_thinking 标志可选地开启推理、采用滚动检查点机制动态管理上下文、优化工具参数序列化以避免双重转义,以及移除了默认系统提示词。

    推荐理由:通过对比 Jinja 模板差异,揭示了 Qwen-3 在推理开关、上下文管理和工具调用上的关键改进。

4月29日周二
  1. Hugging Face Blog70

    Intel 发布 AutoRound 大模型与多模态模型量化工具

    Intel 发布 AutoRound,一种用于 LLM 和 VLM 的权重量后训练量化(PTQ)工具。它通过符号梯度下降联合优化权重舍入和裁剪范围,在 INT2 至 INT8 低比特量化下保持高精度,量化 72B 模型仅需 37 分钟。支持 Qwen、LLaMA 等主流模型,兼容 CPU/GPU,可导出为 AutoRound、GPTQ、AWQ 和 GGUF 格式。

    推荐理由:Intel 发布 AutoRound 工具,以低算力开销实现高精度低比特量化,为 LLM 和 VLM 的高效部署提供新方案。

  2. Hugging Face Blog75

    Meta 发布 Llama Guard 4 多模态安全模型

    Meta 发布 Llama Guard 4,这是一个 12B 参数的密集多模态安全模型,用于检测输入和输出中的不安全内容。该模型基于 Llama 4 Scout 剪枝而来,可在单张 24GB 显存 GPU 上运行,支持 14 类危害分类及多语言处理。同时发布的还有 Llama Prompt Guard 2 系列,专注于检测提示词注入和越狱攻击。

    推荐理由:Meta 开源了基于 Llama 4 Scout 剪枝的多模态安全模型,提供了单卡部署方案与代码示例。

4月26日周六
  1. Hugging Face Blog75

    ServiceNow开源PipelineRL,实现推理中权重更新

    ServiceNow开源PipelineRL,通过推理中权重更新解决大规模LLM强化学习中的延迟与吞吐权衡问题。在7B和32B模型上,其推理性能与Open-Reasoner-Zero相当,但算法更简单且训练稳定。

    推荐理由:ServiceNow开源PipelineRL,通过推理中权重更新解决RL训练中的延迟与吞吐权衡问题。

4月25日周五
  1. Hugging Face Blog78

    Hugging Face 发布50行代码实现的 MCP 智能体教程

    Hugging Face 发布教程,展示如何用50行 TypeScript 代码基于 MCP 协议构建智能体。该实现通过 InferenceClient 连接 MCP 服务器加载工具,利用 LLM 原生工具调用能力在 while 循环中交替执行工具与生成回复,默认使用 Qwen2.5-72B-Instruct 模型。

    推荐理由:原文以50行代码演示了基于MCP协议构建Agent的极简实现,提供了可直接复用的核心代码与运行方法。

4月24日周四
4月23日周三
4月22日周二
4月16日周三
  1. OpenAI News83

    OpenAI发布o3和o4-mini系统卡片

    OpenAI发布o3和o4-mini系统卡片,指出两者结合了最先进的推理能力与完整的工具功能,包括网页浏览、Python执行、图像与文件分析、图像生成、Canvas、自动化、文件搜索和记忆。

    推荐理由:官方明确了o3和o4-mini的推理能力与工具调用范围,为评估其实际工作流价值提供了基准。

  2. OpenAI News95

    OpenAI 发布 o3 和 o4-mini 模型

    OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。

    推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。

4月15日周二
4月14日周一
  1. OpenAI News86

    OpenAI 发布 GPT-4.1 模型系列及首个 nano 模型

    OpenAI 在 API 中发布 GPT-4.1 新模型家族,在编码、指令遵循和长上下文理解方面实现全面改进,并首次发布 nano 模型,面向全球开发者开放。

    推荐理由:GPT-4.1 系列在编码、指令遵循和长上下文理解上全面增强,并首次推出 nano 模型,开发者可立即通过 API 接入。

  2. Hugging Face Blog68

    Hugging Face 收购 Pollen Robotics 进军开源具身智能

    Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五笔收购。此次整合旨在将 LeRobot 软件平台与 Reachy 2 等开源硬件结合,推动 AI 与物理世界的交互。Reachy 2 已面向研究机构和开发者开放订购,定价为 7 万美元。

    推荐理由:Hugging Face 收购 Pollen Robotics 补齐了具身智能硬件能力,标志着其开源生态从软件向实体机器人领域的实质性延伸。

4月11日周五
4月10日周四
4月9日周三
  1. Mistral AI61

    Mistral 发布基于 RAG Triad 的 LLM 评估教程

    Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。

    推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。

4月7日周一
  1. OpenAI News25

    OpenAI 发布欧盟经济蓝图

    OpenAI 发布欧盟经济蓝图,提出一系列旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长的政策建议。该蓝图强调确保人工智能在欧洲境内开发、部署并服务于欧洲。