Mistral 发布万亿参数模型 Le Chonk,挑战顶级 AI
Mistral 发布万亿参数模型 Mistral Large 4(昵称 Le Chonk),主打编程与网络安全,声称性能接近顶级闭源模型。
推荐理由:Mistral 发布万亿参数开源模型,主打编程与垂直领域,提供闭源替代方案。
Mistral 发布万亿参数模型 Mistral Large 4(昵称 Le Chonk),主打编程与网络安全,声称性能接近顶级闭源模型。
推荐理由:Mistral 发布万亿参数开源模型,主打编程与垂直领域,提供闭源替代方案。
OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。
推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。
Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。
推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。
Reflection 发布 Beam,一款 501B 总参数 / 23B 激活参数的 MoE 代码模型,声称在 SWE-bench Verified 上得分 80.9,推理效率是 GLM 5.2 的 3–4 倍。该模型使用 23.8T 预训练 token 从头训练,全量权重将于本月以 Apache 2.0 协议开源。
Google 发布 Gemini 4 Argon 模型,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token,支持 100 万 token 输出。该模型在 DeepSWE v1.1 基准测试中得分 77.9%,已用于内部代码迁移并节省大量内存。
推荐理由:Argon 提供百万级输出与工程基准领先数据,可评估其在长程任务与代码重构中的实际价值。
Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。
推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。
Anthropic 发布 Claude Sonnet 5.5,宣称速度提升 30% 以上且成本降低,在多项基准测试中表现优于 Sonnet 5。该模型现已成为 claude.ai 免费层默认模型,实测编码能力接近 Opus 5.5。
推荐理由:原文实测了模型在编码和推理上的表现,并指出其已取代旧版成为免费层模型,直接影响普通用户的可用能力。
Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。
推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。
Google DeepMind 发布 Gemini 3.7 Flash,在编码、智能体和复杂文档处理任务上显著优于 3.6 Flash,并提供半价定价。该模型已用于 Gemini Spark,并更新了 CBRN 和网络安全方面的安全护栏。
推荐理由:在编码和智能体任务上性能显著提升,并提供半价定价,有助于开发者低成本扩展生产级应用。
Mistral 发布 Leanstral 1.5,一款 6B 激活参数的开源形式化推理模型,在 miniF2F、PutnamBench 和 FATE-H/X 基准上刷新 SOTA。该模型通过长上下文推理在代码验证中发现多个隐藏 Bug,并提供免费 API 与 Hugging Face 权重。
推荐理由:在形式化验证基准上刷新SOTA且成本极低,展示了长上下文推理在代码验证中的实际效用。
JetBrains 发布 Mellum2,一个 12B 参数的 MoE 模型,每 token 仅激活 2.5B 参数,推理速度比同类模型快 2 倍以上。该模型开源并支持 Apache 2.0 协议,适用于路由、RAG、子智能体和私有部署。
推荐理由:原文给出了模型架构和性能数据,读者可以据此评估它在多模型系统中的路由和编排价值。
IBM 发布 Granite 4.1 系列(3B、8B、30B)开源大语言模型,采用 Apache 2.0 协议。该系列在约 15T tokens 上预训练并支持 512K 上下文,通过多阶段强化学习显著提升了数学、编码和工具调用能力。其中 8B 模型在多项基准上匹敌或超越前代 32B MoE 模型。
推荐理由:原文详述了数据工程与多阶段强化学习等训练细节,展示了8B密集模型在多项基准上匹敌更大MoE架构的能力。
Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。
推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。
Mistral 发布 Leanstral,首个专为 Lean 4 设计的开源代码智能体,采用 6B 激活参数架构。在 FLT 项目验证基准上,其 pass@2 得分超越 Claude Sonnet 4.6,且运行成本仅为后者的约 1/15。模型以 Apache 2.0 协议开源,支持 Mistral Vibe 集成与 MCP 工具调用。
推荐理由:Leanstral 以极低成本在形式化验证基准上超越闭源模型,为高可靠性代码生成提供了开源替代方案。
Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。
推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。
Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。
推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。
Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。
推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。
Mistral AI 发布 Devstral Medium 和升级版的 Devstral Small 1.1。Devstral Medium 在 SWE-Bench Verified 上得分 61.6%,超越 Gemini 2.5 Pro 和 GPT 4.1,价格仅为后者的四分之一。
推荐理由:Devstral Medium 在 SWE-Bench Verified 上超越 Gemini 2.5 Pro 且价格更低,Small 1.1 开源并刷新开放模型记录。
Mistral 发布 Devstral 智能体编码模型,在 SWE-Bench Verified 基准上取得 46.8% 成绩,超越 Deepseek-V3 和 Qwen3 等更大模型。该模型支持本地部署与 API 调用,提供 Apache 2.0 开源许可。
推荐理由:Mistral 发布 Devstral 智能体模型,在 SWE-Bench Verified 基准上超越开源与闭源竞品,并提供本地部署与 API 接入。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一款基于 Transformer 架构的编码器模型,包含 Base(1.49 亿参数)和 Large(3.95 亿参数)两个版本。
推荐理由:ModernBERT 将上下文窗口扩展至 8192 并大幅提升推理速度,为 RAG 和代码检索提供了更高效的开源替代方案。
TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。
推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。
Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。
推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。
Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。
推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Hugging Face 发布 StarCoder 和 StarCoderBase 代码大语言模型,在 HumanEval 等基准上达到开源 SOTA。模型基于 The Stack 数据集训练,提供完整训练数据、PII 移除工具及 BigCode OpenRAIL-M 许可证。
推荐理由:模型在HumanEval等基准上达到开源SOTA,提供完整训练数据与治理工具,适合二次开发。