跳到正文

#推理

今日 0 条
12月17日周三
  1. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

12月16日周二
  1. Google Research72

    Google 推出 Gemini 论文辅助工具,在 STOC 2026 中验证推理能力

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。

    推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。

12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月4日周四
  1. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

11月25日周二
11月13日周四
  1. Google DeepMind75

    Google DeepMind 发布 SIMA 2:基于 Gemini 推理的 3D 世界通用智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。

    推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。

  2. Google Research28

    Google Quantum AI 发布量子优化工具包 DQI

    Google Quantum AI 发布名为 Decoded Quantum Interferometry (DQI) 的量子算法,用于解决经典计算机难以处理的优化问题。该算法将优化问题转化为解码问题,在最优多项式交集(OPI)任务中,仅需数百万次量子逻辑操作即可求解,而经典计算机需超过 10^23 次操作。

11月8日周六
10月31日周五
10月16日周四
9月12日周五
  1. Hugging Face Blog68

    Writer 发布 Palmyra-mini 系列轻量级推理模型

    Writer 发布 Palmyra-mini 系列三款 1.5B 至 1.7B 参数量的开源模型,包含通用基座及针对逻辑和数学优化的推理变体。模型采用 Qwen 架构,支持 GGUF 和 MLX 量化,在 GSM8K 和 AMC23 等基准测试中表现优异。

    推荐理由:Palmyra-mini 系列提供 1.5B 至 1.7B 参数量的轻量级模型,兼顾推理与通用生成,适合端侧部署。

8月14日周四
  1. Hugging Face Blog70

    Hugging Face开源Kimina-Prover-RL训练管线及Lean 4定理证明模型

    Hugging Face开源了Kimina-Prover-RL,一个基于Verl框架的Lean 4形式化定理证明训练管线,并发布了1.7B和0.6B两个模型。该管线采用类DeepSeek-R1的结构化推理范式,结合格式奖励和错误纠正机制,在MiniF2F基准上刷新了开源模型在对应参数规模下的SOTA成绩。

    推荐理由:开源了基于Verl的Lean 4定理证明训练管线及0.6B和1.7B模型,为小参数模型形式化推理提供了可复现的SOTA方案。

8月13日周三
8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

  2. Hugging Face Blog68

    NVIDIA 开源 AI-Q 智能体栈,Llama Nemotron 登顶 DeepResearch Bench

    NVIDIA 发布开源 AI-Q 智能体栈,基于 Llama 3.3-70B 和 Llama-3.3-Nemotron-Super-49B-v1.5 模型,在 Hugging Face DeepResearch Bench 的 LLM with Search 类别中以 40.52 分登顶。该方案支持本地部署与隐私合规,提供完整的推理追踪与评估指标。

    推荐理由:NVIDIA 开源 AI-Q 智能体栈并在 DeepResearch Bench 登顶,展示了 Llama Nemotron 在复杂推理任务中的能力。

8月1日周五
  1. Hugging Face Blog30

    3LM:面向阿拉伯语大语言模型的 STEM 与代码基准测试

    Hugging Face 发布 3LM 基准测试,专门评估阿拉伯语大语言模型在 STEM 学科和代码生成领域的表现。该基准包含 865 道原生 STEM 选择题、1,744 道合成高难度题目及基于 HumanEval+ 和 MBPP+ 翻译的代码任务。测试显示 Qwen2.5-72B-Instruct 在 STEM 选择题中表现最佳,GPT-4o 在代码生成任务中得分最高。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

2月4日周二
  1. Hugging Face Blog68

    Hugging Face 与 Adyen 联合发布 DABStep 多步推理数据智能体基准

    Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。

    推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。

1月31日周五
  1. Hugging Face Blog77

    Mini-R1:用GRPO复现DeepSeek R1的“顿悟时刻”强化学习教程

    Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。

    推荐理由:文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。

1月30日周四
  1. Mistral AI82

    Mistral 发布 Mistral Small 3 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。

    推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。

1月28日周二
  1. Hugging Face Blog73

    Hugging Face 发布 Open-R1 项目开源复现 DeepSeek-R1

    Hugging Face 发布 Open-R1 项目,旨在系统复现 DeepSeek-R1 的数据收集与纯强化学习训练流程。项目计划通过蒸馏高质量推理数据集、构建数学与代码数据集,并开源多阶段训练配方,以验证并推广推理模型技术。

    推荐理由:Hugging Face 宣布启动开源复现项目,旨在公开 DeepSeek-R1 的训练数据与代码,推动推理模型技术透明化。

12月18日周三
  1. Hugging Face Blog74

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。

    推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。

12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

11月25日周一
  1. Hugging Face Blog38

    你可能本可以设计出最先进的旋转位置编码

    本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。

10月10日周四
8月14日周三
8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

6月5日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Falcon 开源大语言模型

    阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。

    推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。

5月11日周四
  1. Hugging Face Blog78

    Hugging Face 推出辅助生成技术降低文本生成延迟

    Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。

    推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。

3月10日周五
1月24日周二
  1. Hugging Face Blog36

    对话智能体为何有用?

    本文梳理 ChatGPT、LaMDA、BlenderBot 等对话智能体的技术细节,指出指令遵循(IFT)与监督微调(SFT)是核心共性。文章详细解析了基于人类标注与模型引导的数据构建方法,并探讨了 RLHF 等对齐技术在确保模型安全与有用性方面的关键作用。