OpenAI 发布 o3 和 o4-mini 模型
OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。
推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。
推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。
OpenAI 在 API 中发布 GPT-4.1 新模型家族,在编码、指令遵循和长上下文理解方面实现全面改进,并首次发布 nano 模型,面向全球开发者开放。
推荐理由:GPT-4.1 系列在编码、指令遵循和长上下文理解上全面增强,并首次推出 nano 模型,开发者可立即通过 API 接入。
Hugging Face 上线 Meta 发布的 Llama 4 Maverick (~400B) 与 Scout (~109B) 原生多模态模型,两者均为 MoE 架构且激活参数为 17B。Scout 支持 10M 超长上下文并可单卡量化部署,Maverick 在 MMLU-Pro 等基准上显著超越 Llama 3.1 405B。
推荐理由:文章详细披露了MoE架构、超长上下文及量化部署细节,为开发者提供了关键的技术选型依据。
DeepSeek 发布 DeepSeek-V3-0324 模型,在 AIME 和 LiveCodeBench 等基准上显著提升,并采用 MIT 许可证。Hugging Face 提供了通过 TGI、SGLang 及 Unsloth 量化进行本地部署的方法,并说明了模型权重与代码的安全使用规范。
推荐理由:文章详细对比了 DeepSeek-V3-0324 在多项基准上的提升,并提供了本地部署与安全使用的具体指南。
Google 发布多模态开源大语言模型 Gemma 3,包含 1B 至 27B 参数版本,支持 128k 上下文窗口和 140 多种语言。其中 4B 及以上版本具备图文处理能力,Gemma 3 27B 在多项基准测试中表现优异,并原生支持 Transformers、MLX 及 llama.cpp 等生态。
推荐理由:Google 发布支持 128k 上下文和 140+ 语言的多模态开源模型,提供端侧部署方案。
OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型。
推荐理由:OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型,提供前沿能力体验。
OpenAI 发布 o3-mini 模型。
Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。
推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。
OpenAI 发布针对 o1 模型的新对齐策略,直接教授模型安全规范及其推理能力。
推荐理由:原文介绍了o1模型的新对齐策略,读者可据此了解模型安全机制的演进方向。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一款基于 Transformer 架构的编码器模型,包含 Base(1.49 亿参数)和 Large(3.95 亿参数)两个版本。
推荐理由:ModernBERT 将上下文窗口扩展至 8192 并大幅提升推理速度,为 RAG 和代码检索提供了更高效的开源替代方案。
OpenAI 发布 o1 模型,并推出 Realtime API 改进及新的微调方法等开发者工具。
推荐理由:OpenAI 发布 o1 模型并更新开发者工具,提供模型能力变化与接入入口。
Cohere For AI 发布 Aya Expanse 系列多语言大语言模型,包含 8B 和 32B 参数版本,并在 Hugging Face 开源权重。
推荐理由:Aya Expanse 通过数据套利与模型融合等创新训练策略,在多项多语言评测中超越 Llama 3.1 等主流模型,为多语言大模型训练提供了新的技术路径。
OpenAI 发布 o1 模型。
OpenAI 发布 o1-mini 模型,旨在推进成本高效的推理能力。
TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。
推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。
Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。
推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。
Hugging Face 发布 Llama 3.1 系列模型,包含 405B、70B 和 8B 三种规格,支持多语言与长上下文能力。
推荐理由:Llama 3.1 带来 405B 大参数模型与长上下文支持,为开源多模态生态提供了新的基线选择。
OpenAI 发布 GPT-4o mini 模型,旨在推进成本效益更高的智能。
TII 发布 Falcon 2 系列模型,包含 11B 参数语言模型与视觉语言模型(VLM),均在 5000B tokens 数据上训练。11B LLM 在多项基准上超越 Llama3-8B 和 Mistral-7B,支持 11 种语言;11B VLM 集成 CLIP 视觉编码器,在 MME 等基准上表现优异。模型采用 Apache 2.0 衍生许可开源。
推荐理由:Falcon 2 提供 11B 参数语言模型与视觉语言模型,兼顾多语言与代码能力,为端侧部署提供高性价比选择。
OpenAI 发布 GPT-4 Omni 旗舰模型,支持在音频、视觉和文本之间进行实时推理。
推荐理由:GPT-4 Omni 支持实时跨音频、视觉和文本推理,为多模态交互提供了新的技术基准。