Mistral 发布万亿参数模型 Le Chonk,挑战顶级 AI
Mistral 发布万亿参数模型 Mistral Large 4(昵称 Le Chonk),主打编程与网络安全,声称性能接近顶级闭源模型。
推荐理由:Mistral 发布万亿参数开源模型,主打编程与垂直领域,提供闭源替代方案。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Mistral 发布万亿参数模型 Mistral Large 4(昵称 Le Chonk),主打编程与网络安全,声称性能接近顶级闭源模型。
推荐理由:Mistral 发布万亿参数开源模型,主打编程与垂直领域,提供闭源替代方案。
OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。
推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。
Google 发布 Gemini 4 Argon 模型,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token,支持 100 万 token 输出。该模型在 DeepSWE v1.1 基准测试中得分 77.9%,已用于内部代码迁移并节省大量内存。
推荐理由:Argon 提供百万级输出与工程基准领先数据,可评估其在长程任务与代码重构中的实际价值。
Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。
推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。
微软发布并开源分子合成预测模型 RetroChimera,该模型融合 R-SMILES 2 与 NeuralLoc 两种架构,通过集成学习策略在盲测中表现优于单一模型。
推荐理由:模型融合两种架构互补优势并开源,为化学合成路线规划提供了可复用的前沿工具。
Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型,支持近实时视觉输入、97 种语言自动切换及后台工具调用。3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数中排名第一,并在 τ-Voice 基准测试中展现多步推理能力。
推荐理由:新增实时对话与扩展推理能力,提供语音基准数据与多语言支持,便于开发者构建生产级语音智能体。
IBM 发布 Granite 4.2 推理模型系列,包含 3B、8B 和 30B 三个尺寸,采用密集解码器架构并支持思考模式切换与原生工具调用。模型基于约 15T token 预训练,并通过包含 SWE、终端和搜索的多阶段强化学习进行后训练,在 SWE-bench Verified 等基准上表现强劲。
推荐理由:原文披露了从预训练到多阶段强化学习的完整构建细节,为同类模型提供了可迁移的技术参考。
Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。
推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。
JetBrains 发布 Mellum2,一个 12B 参数的 MoE 模型,每 token 仅激活 2.5B 参数,推理速度比同类模型快 2 倍以上。该模型开源并支持 Apache 2.0 协议,适用于路由、RAG、子智能体和私有部署。
推荐理由:原文给出了模型架构和性能数据,读者可以据此评估它在多模型系统中的路由和编排价值。