跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 41–60 条 · 共 78 条
9月15日周一
  1. OpenAI News72

    OpenAI 发布 GPT-5-Codex 模型

    OpenAI 发布 GPT-5-Codex,这是 GPT-5 针对 Codex 智能体编码优化的版本。该模型可根据任务复杂度动态调整推理深度,对简单查询快速响应,对复杂任务独立进行更长时间的思考。

    推荐理由:GPT-5-Codex 针对智能体编码场景优化,可根据任务复杂度动态调整推理深度,兼顾响应速度与复杂任务处理能力。

8月7日周四
  1. OpenAI News92

    OpenAI 发布 GPT-5 for developers

    OpenAI 在 API 平台正式推出 GPT-5,提供针对开发者的新控制选项,并在真实编码任务中实现最佳结果。

    推荐理由:官方宣布 GPT-5 API 上线,强调推理性能与编码任务表现,开发者可据此评估升级价值。

  2. OpenAI News95

    OpenAI 发布 GPT-5 模型

    OpenAI 发布 GPT-5,宣称其在编码、数学、写作、健康、视觉感知等领域具备最新性能,是此前模型在智能上的重大飞跃。

    推荐理由:GPT-5 在编码、数学和视觉感知等核心能力上宣称达到最新水平,为评估其实际智能跃升提供了基准。

8月5日周二
  1. OpenAI News86

    OpenAI 发布 gpt-oss 开源模型系列

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可证。模型在推理任务上表现优异,具备强大的工具使用能力,并针对消费级硬件进行了高效部署优化。

    推荐理由:OpenAI 发布两款开源模型,兼顾推理性能与消费级硬件部署成本,为开发者提供新选择。

  2. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

6月10日周二
  1. Mistral AI82

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。

    推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。

5月21日周三
  1. Hugging Face Blog82

    Falcon-H1 系列混合架构模型发布,长上下文吞吐量最高提升 8 倍

    TII 发布 Falcon-H1 系列开源模型,包含 0.5B 至 34B 六种规模及指令微调版本,采用 Attention 与 SSM 混合架构。该系列原生支持 18 种语言,上下文窗口达 256K,在长序列生成时吞吐量最高提升 8 倍,且小参数模型性能媲美更大规模的 Transformer 模型。

    推荐理由:混合架构在长上下文下吞吐量提升显著,为资源受限场景提供了兼顾性能与效率的开源替代方案。

  2. Hugging Face Blog63

    Falcon-Arabic 发布:基于 Falcon 3 架构的 7B 阿拉伯语模型

    TII 发布 Falcon-Arabic,这是一个基于 Falcon 3 架构的 7B 参数多语言模型,通过扩展词表至 32,000 个阿拉伯语 token 并采用新颖的嵌入初始化策略进行适配。该模型在 OALL v2 基准测试中表现优异,超越同规模及其他规模达 4 倍的阿拉伯语 LLM,支持现代标准阿拉伯语及多种方言,并提供 Base 和 Instruct 两个版本的开源权重及在线演示。

    推荐理由:Falcon-Arabic 基于 Falcon 3 架构适配阿拉伯语,在 OALL 基准测试中超越同规模及更大模型,提供开源权重与演示入口。

4月16日周三
  1. OpenAI News83

    OpenAI发布o3和o4-mini系统卡片

    OpenAI发布o3和o4-mini系统卡片,指出两者结合了最先进的推理能力与完整的工具功能,包括网页浏览、Python执行、图像与文件分析、图像生成、Canvas、自动化、文件搜索和记忆。

    推荐理由:官方明确了o3和o4-mini的推理能力与工具调用范围,为评估其实际工作流价值提供了基准。

  2. OpenAI News95

    OpenAI 发布 o3 和 o4-mini 模型

    OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。

    推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。

4月14日周一
  1. OpenAI News86

    OpenAI 发布 GPT-4.1 模型系列及首个 nano 模型

    OpenAI 在 API 中发布 GPT-4.1 新模型家族,在编码、指令遵循和长上下文理解方面实现全面改进,并首次发布 nano 模型,面向全球开发者开放。

    推荐理由:GPT-4.1 系列在编码、指令遵循和长上下文理解上全面增强,并首次推出 nano 模型,开发者可立即通过 API 接入。

4月5日周六
  1. Hugging Face Blog96

    Hugging Face 上线 Llama 4 Maverick 与 Scout 模型

    Hugging Face 上线 Meta 发布的 Llama 4 Maverick (~400B) 与 Scout (~109B) 原生多模态模型,两者均为 MoE 架构且激活参数为 17B。Scout 支持 10M 超长上下文并可单卡量化部署,Maverick 在 MMLU-Pro 等基准上显著超越 Llama 3.1 405B。

    推荐理由:文章详细披露了MoE架构、超长上下文及量化部署细节,为开发者提供了关键的技术选型依据。

3月27日周四
  1. Hugging Face Blog82

    DeepSeek-V3-0324 发布,强化推理与编码能力

    DeepSeek 发布 DeepSeek-V3-0324 模型,在 AIME 和 LiveCodeBench 等基准上显著提升,并采用 MIT 许可证。Hugging Face 提供了通过 TGI、SGLang 及 Unsloth 量化进行本地部署的方法,并说明了模型权重与代码的安全使用规范。

    推荐理由:文章详细对比了 DeepSeek-V3-0324 在多项基准上的提升,并提供了本地部署与安全使用的具体指南。

3月12日周三
  1. Hugging Face Blog92

    Google 发布多模态开源大模型 Gemma 3

    Google 发布多模态开源大语言模型 Gemma 3,包含 1B 至 27B 参数版本,支持 128k 上下文窗口和 140 多种语言。其中 4B 及以上版本具备图文处理能力,Gemma 3 27B 在多项基准测试中表现优异,并原生支持 Transformers、MLX 及 llama.cpp 等生态。

    推荐理由:Google 发布支持 128k 上下文和 140+ 语言的多模态开源模型,提供端侧部署方案。

2月27日周四
  1. OpenAI News80

    OpenAI 发布 GPT-4.5 研究预览版

    OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型。

    推荐理由:OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型,提供前沿能力体验。

1月31日周五
1月30日周四
  1. Mistral AI82

    Mistral 发布 Mistral Small 3 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。

    推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。

12月20日周五
12月19日周四