跳到正文

#推理

今日 3 条
4月20日周一
4月9日周四
  1. Google Research60

    Google 发布 PaperVizAgent 与 ScholarPeer 两个科研 AI 智能体

    Google Research 发布两个实验性 AI 智能体:PaperVizAgent 可从文本自动生成出版级学术图表,在多项指标上超越 GPT-Image-1.5 等基线;ScholarPeer 模拟资深审稿人,通过多智能体协作和实时文献检索生成深度评审意见。

    推荐理由:Google 发布两个实验性 AI 智能体,分别用于生成高质量学术图表和模拟资深审稿人,展示了 AI 深度介入科研流程的潜力。

3月18日周三
  1. Google DeepMind43

    Google DeepMind 发布 AGI 认知评估框架

    Google DeepMind 发布“AGI 认知分类”框架,提出感知、推理等 10 项关键认知能力以衡量通用人工智能进展。该框架配套发布 Kaggle 黑客松,邀请社区针对学习、元认知等五项能力构建评估基准。活动提供 20 万美元奖金池,提交截止至 4 月 16 日。

3月17日周二
  1. Mistral AI88

    Mistral 发布 Mistral Small 4 统一模型

    Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。

    推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。

3月13日周五
  1. Berkeley AI Research42

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,实现大规模 LLM 交互作用的高效识别

    Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,通过稀疏恢复和层级结构特性,以极少消融次数高效识别 LLM 中的关键交互作用。ProxySPEX 在保持 SPEX 性能的同时,将消融次数减少约 10 倍。该方法在数千特征的上下文窗口中仍能保持高忠实度,显著优于 LIME 等边际方法。

3月9日周一
  1. Google DeepMind22

    从游戏到生物学:AlphaGo 十年影响力回顾

    Google DeepMind 回顾 AlphaGo 十年影响力,其突破开启了现代 AI 时代并推动 AGI 发展。AlphaGo 的搜索与强化学习技术衍生出 AlphaFold 2,成功预测 2 亿种蛋白质结构并获诺贝尔奖。此外,相关技术已应用于 AlphaProof 数学推理、AlphaEvolve 算法发现及 AI 共科学家等前沿科学领域。

3月5日周四
  1. Google Research65

    Google Research:通过模仿贝叶斯模型训练大语言模型

    Google Research 发表论文,提出通过监督微调让大语言模型模仿贝叶斯助手,从而学会概率推理。该方法使模型在航班推荐任务中显著优于基线,并能将学到的推理能力泛化至酒店推荐和网购等未见领域。

    推荐理由:研究提出通过模仿贝叶斯模型进行监督微调,使大模型学会概率推理并跨领域泛化。

3月4日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.1 Flash-Lite 模型

    Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。

    推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。

2月20日周五
  1. Google DeepMind80

    Gemini 3.1 Pro 发布,ARC-AGI-2 得分翻倍

    Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的得分,推理性能是 3 Pro 的两倍以上。该模型已在 Gemini API、Vertex AI、Gemini CLI、Android Studio 及 NotebookLM 等平台开放预览。

    推荐理由:ARC-AGI-2得分翻倍体现推理能力跃升,覆盖开发者与企业场景,可据此评估复杂任务处理潜力。

2月13日周五
  1. Google DeepMind85

    Gemini 3 Deep Think 重大升级并开放 API 访问

    Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。

    推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。

2月10日周二
  1. Google DeepMind88

    Google DeepMind发布Gemini Deep Think科研级应用与数学研究智能体

    Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。

    推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。

1月20日周二
  1. Hugging Face Blog40

    DIFF Transformer V2 发布

    微软发布 DIFF Transformer V2,通过差分注意力机制在保持键值头数量不变的前提下倍增查询头,实现与标准 Transformer 相当的解码速度。该版本移除了 DIFF V1 中导致数值不稳定的逐头 RMSNorm 层,有效消除注意力汇聚现象。相比同等查询维度的 Transformer,DIFF V2 在输出投影阶段拥有更少的参数和计算量。

12月19日周五
12月17日周三
  1. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

12月16日周二
  1. Google Research72

    Google 推出 Gemini 论文辅助工具,在 STOC 2026 中验证推理能力

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。

    推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。

12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月4日周四
  1. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

11月25日周二
11月13日周四
  1. Google DeepMind75

    Google DeepMind 发布 SIMA 2:基于 Gemini 推理的 3D 世界通用智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。

    推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。

  2. Google Research28

    Google Quantum AI 发布量子优化工具包 DQI

    Google Quantum AI 发布名为 Decoded Quantum Interferometry (DQI) 的量子算法,用于解决经典计算机难以处理的优化问题。该算法将优化问题转化为解码问题,在最优多项式交集(OPI)任务中,仅需数百万次量子逻辑操作即可求解,而经典计算机需超过 10^23 次操作。

11月8日周六
10月31日周五
10月16日周四
9月12日周五
  1. Hugging Face Blog68

    Writer 发布 Palmyra-mini 系列轻量级推理模型

    Writer 发布 Palmyra-mini 系列三款 1.5B 至 1.7B 参数量的开源模型,包含通用基座及针对逻辑和数学优化的推理变体。模型采用 Qwen 架构,支持 GGUF 和 MLX 量化,在 GSM8K 和 AMC23 等基准测试中表现优异。

    推荐理由:Palmyra-mini 系列提供 1.5B 至 1.7B 参数量的轻量级模型,兼顾推理与通用生成,适合端侧部署。

8月14日周四
  1. Hugging Face Blog70

    Hugging Face开源Kimina-Prover-RL训练管线及Lean 4定理证明模型

    Hugging Face开源了Kimina-Prover-RL,一个基于Verl框架的Lean 4形式化定理证明训练管线,并发布了1.7B和0.6B两个模型。该管线采用类DeepSeek-R1的结构化推理范式,结合格式奖励和错误纠正机制,在MiniF2F基准上刷新了开源模型在对应参数规模下的SOTA成绩。

    推荐理由:开源了基于Verl的Lean 4定理证明训练管线及0.6B和1.7B模型,为小参数模型形式化推理提供了可复现的SOTA方案。

8月13日周三
8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

  2. Hugging Face Blog68

    NVIDIA 开源 AI-Q 智能体栈,Llama Nemotron 登顶 DeepResearch Bench

    NVIDIA 发布开源 AI-Q 智能体栈,基于 Llama 3.3-70B 和 Llama-3.3-Nemotron-Super-49B-v1.5 模型,在 Hugging Face DeepResearch Bench 的 LLM with Search 类别中以 40.52 分登顶。该方案支持本地部署与隐私合规,提供完整的推理追踪与评估指标。

    推荐理由:NVIDIA 开源 AI-Q 智能体栈并在 DeepResearch Bench 登顶,展示了 Llama Nemotron 在复杂推理任务中的能力。

8月1日周五
  1. Hugging Face Blog30

    3LM:面向阿拉伯语大语言模型的 STEM 与代码基准测试

    Hugging Face 发布 3LM 基准测试,专门评估阿拉伯语大语言模型在 STEM 学科和代码生成领域的表现。该基准包含 865 道原生 STEM 选择题、1,744 道合成高难度题目及基于 HumanEval+ 和 MBPP+ 翻译的代码任务。测试显示 Qwen2.5-72B-Instruct 在 STEM 选择题中表现最佳,GPT-4o 在代码生成任务中得分最高。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

2月4日周二
  1. Hugging Face Blog68

    Hugging Face 与 Adyen 联合发布 DABStep 多步推理数据智能体基准

    Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。

    推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。

1月31日周五
  1. Hugging Face Blog77

    Mini-R1:用GRPO复现DeepSeek R1的“顿悟时刻”强化学习教程

    Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。

    推荐理由:文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。

1月30日周四
  1. Mistral AI82

    Mistral 发布 Mistral Small 3 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。

    推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。

1月28日周二
  1. Hugging Face Blog73

    Hugging Face 发布 Open-R1 项目开源复现 DeepSeek-R1

    Hugging Face 发布 Open-R1 项目,旨在系统复现 DeepSeek-R1 的数据收集与纯强化学习训练流程。项目计划通过蒸馏高质量推理数据集、构建数学与代码数据集,并开源多阶段训练配方,以验证并推广推理模型技术。

    推荐理由:Hugging Face 宣布启动开源复现项目,旨在公开 DeepSeek-R1 的训练数据与代码,推动推理模型技术透明化。

12月18日周三
  1. Hugging Face Blog74

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。

    推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。

12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

11月25日周一
  1. Hugging Face Blog38

    你可能本可以设计出最先进的旋转位置编码

    本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。

10月10日周四
8月14日周三
8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。