跳到正文

#推理

今日 0 条
10月7日周三
  1. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

10月6日周二
10月2日周五
  1. Hugging Face Blog65

    Ai2 开源 AstaBrief 8B 科学报告生成模型

    Ai2 开源了 AstaBrief 8B 模型,该模型基于 Qwen3-8B 微调,专为快速生成带引用的科学文献综述报告而设计。在 Asta 平台中,该模型作为 Fast 模式上线,报告生成速度比原有的 Thinking 模式快约 3.5 倍,同时保持了相近的引用准确性和用户满意度。

    推荐理由:开源了针对科学报告生成的轻量模型,提供了一整套数据筛选与评估方法,可迁移至其他垂直领域。

10月1日周四
  1. Google DeepMind90

    Google 发布 Gemini 4 Argon 模型,输出上限扩至 100 万 token

    Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。

    推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。

9月3日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.8 Flash 及网络安全版

    Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。

    推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。

8月25日周二
  1. Hugging Face Blog82

    IBM 发布 Granite 4.2 推理模型系列

    IBM 发布 Granite 4.2 推理模型系列,包含 3B、8B 和 30B 三个尺寸,采用密集解码器架构并支持思考模式切换与原生工具调用。模型基于约 15T token 预训练,并通过包含 SWE、终端和搜索的多阶段强化学习进行后训练,在 SWE-bench Verified 等基准上表现强劲。

    推荐理由:原文披露了从预训练到多阶段强化学习的完整构建细节,为同类模型提供了可迁移的技术参考。

8月21日周五
  1. Hugging Face Blog75

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.2 倍

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,为 LFM2.5 系列模型提供推测解码路径,在 H100 上最高实现 3.18 倍吞吐提升,在 M4 Max 上最高实现 2.87 倍提升。该方案已开源并支持 llama.cpp 和 SGLang,在保持输出质量不变的前提下显著降低延迟。

    推荐理由:原文给出了具体加速数据与部署配置,读者可据此评估端侧交互体验提升与现有工作流的适配度。

7月2日周四
  1. Mistral AI72

    Mistral 发布 Leanstral 1.5 形式化推理模型

    Mistral 发布 Leanstral 1.5,一款 6B 激活参数的开源形式化推理模型,在 miniF2F、PutnamBench 和 FATE-H/X 基准上刷新 SOTA。该模型通过长上下文推理在代码验证中发现多个隐藏 Bug,并提供免费 API 与 Hugging Face 权重。

    推荐理由:在形式化验证基准上刷新SOTA且成本极低,展示了长上下文推理在代码验证中的实际效用。

6月30日周二
  1. Google Research77

    Google 发布 TabFM 表格数据零样本基础模型

    Google 发布 TabFM,一个专为表格数据设计的零样本基础模型,通过上下文学习消除手动特征工程和超参数调优。该模型在 BigQuery 中原生集成,支持通过 SQL 直接进行回归和分类预测,并在 TabArena 基准测试中表现优异。

    推荐理由:TabFM 将表格预测重构为上下文学习问题,无需微调即可在 BigQuery 中直接运行,大幅简化了传统机器学习工作流。

6月11日周四
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

4月29日周三
  1. Hugging Face Blog78

    IBM 发布 Granite 4.1 系列开源大语言模型

    IBM 发布 Granite 4.1 系列(3B、8B、30B)开源大语言模型,采用 Apache 2.0 协议。该系列在约 15T tokens 上预训练并支持 512K 上下文,通过多阶段强化学习显著提升了数学、编码和工具调用能力。其中 8B 模型在多项基准上匹敌或超越前代 32B MoE 模型。

    推荐理由:原文详述了数据工程与多阶段强化学习等训练细节,展示了8B密集模型在多项基准上匹敌更大MoE架构的能力。

3月17日周二
  1. Mistral AI88

    Mistral 发布 Mistral Small 4 统一模型

    Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。

    推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。

3月4日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.1 Flash-Lite 模型

    Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。

    推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。

2月20日周五
  1. Google DeepMind80

    Gemini 3.1 Pro 发布,ARC-AGI-2 得分翻倍

    Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的得分,推理性能是 3 Pro 的两倍以上。该模型已在 Gemini API、Vertex AI、Gemini CLI、Android Studio 及 NotebookLM 等平台开放预览。

    推荐理由:ARC-AGI-2得分翻倍体现推理能力跃升,覆盖开发者与企业场景,可据此评估复杂任务处理潜力。

2月13日周五
  1. Google DeepMind85

    Gemini 3 Deep Think 重大升级并开放 API 访问

    Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。

    推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。

2月10日周二
  1. Google DeepMind88

    Google DeepMind发布Gemini Deep Think科研级应用与数学研究智能体

    Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。

    推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。

12月17日周三
  1. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

9月12日周五
  1. Hugging Face Blog68

    Writer 发布 Palmyra-mini 系列轻量级推理模型

    Writer 发布 Palmyra-mini 系列三款 1.5B 至 1.7B 参数量的开源模型,包含通用基座及针对逻辑和数学优化的推理变体。模型采用 Qwen 架构,支持 GGUF 和 MLX 量化,在 GSM8K 和 AMC23 等基准测试中表现优异。

    推荐理由:Palmyra-mini 系列提供 1.5B 至 1.7B 参数量的轻量级模型,兼顾推理与通用生成,适合端侧部署。

8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

1月30日周四
  1. Mistral AI82

    Mistral 发布 Mistral Small 3 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。

    推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。

12月18日周三
  1. Hugging Face Blog74

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。

    推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。

12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

6月5日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Falcon 开源大语言模型

    阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。

    推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。