跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 81–100 条 · 共 105 条
3月12日周三
  1. Hugging Face Blog74

    Open R1 发布 OlympicCoder 代码模型及代码推理数据集

    Hugging Face 发布 OlympicCoder-7B 和 32B 模型,在 IOI 基准上超越 Claude 3.7 Sonnet 和 DeepSeek-R1。同时开源了包含近 10 万条样本的 CodeForces-CoTs 数据集及 IOI 评测基准,并分享了训练推理模型的关键经验。

    推荐理由:开源了从 R1 蒸馏的代码推理数据集及 OlympicCoder 模型,并分享了训练推理模型的关键经验。

2月11日周二
  1. Hugging Face Blog72

    Hugging Face 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 发布 OpenR1-Math-220k 数据集,包含 22 万条高质量数学推理轨迹,用于复现 DeepSeek R1 的推理能力。该数据集基于 NuminaMath 1.5,利用 512 张 H100 本地生成,并通过 Math Verify 和 Llama3.3-70B 进行自动过滤。

    推荐理由:Hugging Face 开源了 22 万条数学推理数据集及生成代码,为复现 DeepSeek R1 推理能力提供了可复用的数据与工程方案。

2月4日周二
  1. Hugging Face Blog68

    Hugging Face 与 Adyen 联合发布 DABStep 多步推理数据智能体基准

    Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。

    推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。

2月3日周一
  1. OpenAI News72

    OpenAI 发布 Deep Research 智能体功能

    OpenAI 推出 Deep Research,这是一个利用推理能力综合大量在线信息并完成多步研究任务的智能体。该功能今日向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 推出基于推理的 Agent 处理多步研究任务,明确了 Pro 及 Plus 用户的开放节奏。

2月2日周日
  1. Hugging Face Blog77

    Hugging Face 发布 Open-R1 进展:复现 DeepSeek R1 训练与数据生成

    Hugging Face 发布 Open-R1 项目进展,报告了复现 DeepSeek R1 训练管线与合成数据的最新成果。团队在 MATH-500 基准上验证了复现结果,并分享了利用 TRL 库集成 GRPO 算法及通过 vLLM 优化长文本推理吞吐量的工程经验。

    推荐理由:Hugging Face 团队公开了复现 DeepSeek R1 的训练进展与合成数据生成方案,为社区提供了可验证的参考路径。

1月31日周五
  1. Hugging Face Blog77

    Mini-R1:用GRPO复现DeepSeek R1的“顿悟时刻”强化学习教程

    Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。

    推荐理由:文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。

1月30日周四
  1. Mistral AI82

    Mistral 发布 Mistral Small 3 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。

    推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。

1月28日周二
  1. Hugging Face Blog73

    Hugging Face 发布 Open-R1 项目开源复现 DeepSeek-R1

    Hugging Face 发布 Open-R1 项目,旨在系统复现 DeepSeek-R1 的数据收集与纯强化学习训练流程。项目计划通过蒸馏高质量推理数据集、构建数学与代码数据集,并开源多阶段训练配方,以验证并推广推理模型技术。

    推荐理由:Hugging Face 宣布启动开源复现项目,旨在公开 DeepSeek-R1 的训练数据与代码,推动推理模型技术透明化。

12月18日周三
  1. Hugging Face Blog74

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。

    推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。

12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

9月12日周四
8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

7月16日周二
  1. Mistral AI65

    Mistral 发布 Mathstral 数学推理模型

    Mistral AI 发布 Mathstral,这是一个基于 Mistral 7B 微调的数学推理模型,旨在解决需要复杂多步逻辑推理的高级数学问题。该模型在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%,并在其尺寸类别中实现了最先进的推理能力。

    推荐理由:基于Mistral 7B微调的数学推理模型,在MATH等基准上表现优异,适合端侧部署与特定领域推理。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

2月26日周一
  1. Mistral AI85

    Mistral 发布旗舰模型 Mistral Large 及轻量模型 Mistral Small

    Mistral AI 发布最新旗舰语言模型 Mistral Large,该模型原生支持英法西德意五语,具备 32K 上下文窗口、函数调用及 JSON 格式输出能力,在 MMLU 等基准测试中表现优异,并可通过 Azure 获取。同时发布针对低延迟优化的 Mistral Small 模型,两者均支持函数调用与结构化输出功能。

    推荐理由:Mistral 发布旗舰模型并公布多项基准测试成绩,同时推出轻量模型与 API 功能,便于开发者评估选型。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。