跳到正文

全部动态

今日 47 条
12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog70

    llama.cpp 新增 Router 模式支持多模型动态管理

    llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。

    推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。

  2. OpenAI News78

    OpenAI 发布 GPT-5.2 模型

    OpenAI 发布 GPT-5.2 模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新纪录,展示了在解决开放理论问题和生成可靠数学证明方面的能力。

    推荐理由:GPT-5.2在科学和数学基准上刷新纪录,展示了在解决开放理论问题和生成可靠数学证明方面的实际科研进展。

  3. OpenAI News70

    OpenAI 与迪士尼达成合作,将 200 多个角色引入 Sora

    OpenAI 与迪士尼达成合作,将 200 多个迪士尼、漫威、皮克斯和星球大战角色引入 Sora 用于创作粉丝短片。该协议强调娱乐领域的负责任 AI,并包含迪士尼全面使用 ChatGPT Enterprise 和 OpenAI API。

    推荐理由:OpenAI 与迪士尼达成合作,将 200 多个角色引入 Sora,体现了前沿模型在娱乐领域的商业化落地。

  4. OpenAI News85

    OpenAI 发布 GPT-5.2 模型

    OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型已上线 ChatGPT 和 OpenAI API,旨在支持更快、更可靠的智能体工作流。

    推荐理由:GPT-5.2 定位为日常专业工作的前沿模型,强化了推理、长上下文、编码与视觉能力,旨在优化 ChatGPT 和 API 中的智能体工作流。

  5. Google Research42

    Urania:基于差分隐私的 AI 聊天机器人使用洞察框架

    Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。

12月10日周三
12月9日周二
  1. Mistral AI88

    Mistral 发布 Devstral 2 编码模型及 Vibe CLI 工具

    Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。

    推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。

  2. Google DeepMind68

    Google DeepMind 发布 FACTS Benchmark Suite 评测大模型事实准确性

    Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。

    推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。

12月8日周一
12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月4日周四
  1. Hugging Face Blog80

    Hugging Face Skills 让 Claude 等 Agent 完成 LLM 微调全流程

    Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。

    推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。

  2. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

  3. Google Research42

    Google 发布 MSEB 基准测试:评估多模态听觉智能的八大核心能力

    Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。

12月3日周三
  1. Mistral AI88

    Mistral AI 发布 Mistral 3 模型家族

    Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。

    推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。

12月2日周二
12月1日周一