Mistral 发布 Leanstral 1.5 形式化推理模型
Mistral 发布 Leanstral 1.5,一款 6B 激活参数的开源形式化推理模型,在 miniF2F、PutnamBench 和 FATE-H/X 基准上刷新 SOTA。该模型通过长上下文推理在代码验证中发现多个隐藏 Bug,并提供免费 API 与 Hugging Face 权重。
推荐理由:在形式化验证基准上刷新SOTA且成本极低,展示了长上下文推理在代码验证中的实际效用。
Mistral 发布 Leanstral 1.5,一款 6B 激活参数的开源形式化推理模型,在 miniF2F、PutnamBench 和 FATE-H/X 基准上刷新 SOTA。该模型通过长上下文推理在代码验证中发现多个隐藏 Bug,并提供免费 API 与 Hugging Face 权重。
推荐理由:在形式化验证基准上刷新SOTA且成本极低,展示了长上下文推理在代码验证中的实际效用。
Holo3.1 发布,新增移动端自动化能力并支持函数调用协议,同时推出 0.8B 至 35B-A3B 四种尺寸及 FP8、NVFP4、Q4 GGUF 量化版本,支持在消费级硬件上实现本地化部署。
推荐理由:Holo3.1 扩展了移动端支持并推出端侧量化权重,为本地化部署提供了可迁移的参考。
AllenAI 发布 OlmoEarth v1.1 模型系列,通过优化 Transformer 的 Token 设计将计算成本降低至 v1 的三分之一,同时保持基准性能。该版本包含 Base、Tiny 和 Nano 多种尺寸,支持更高效的卫星图像推理与微调。
推荐理由:通过优化Token设计降低计算成本,为遥感模型的高效部署提供了可复用的工程实践。
IBM 发布基于 ModernBERT 架构的 Granite Embedding Multilingual R2 系列多语言嵌入模型,包含 97M 和 311M 两个版本,支持 200 多种语言和 32K 上下文窗口。
推荐理由:IBM 发布基于 ModernBERT 的多语言嵌入模型,在 32K 长上下文和 97M 极小体积下实现开源同类最高检索质量。
Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。
推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。
IBM 发布 Granite 4.0 Nano 系列模型,包含 350M 和 1B 参数版本,采用混合 SSM 架构或传统 Transformer 架构,面向端侧和 On-device 应用。模型基于 15T tokens 数据训练,支持 vLLM、llama.cpp 和 MLX 等运行环境,并在 IFEval 和 BFCLv3 等基准测试中表现优异。
推荐理由:IBM 发布 3.5 亿至 15 亿参数模型,提供混合架构与传统 Transformer 两种选择,适合端侧部署。
Writer 发布 Palmyra-mini 系列三款 1.5B 至 1.7B 参数量的开源模型,包含通用基座及针对逻辑和数学优化的推理变体。模型采用 Qwen 架构,支持 GGUF 和 MLX 量化,在 GSM8K 和 AMC23 等基准测试中表现优异。
推荐理由:Palmyra-mini 系列提供 1.5B 至 1.7B 参数量的轻量级模型,兼顾推理与通用生成,适合端侧部署。