跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

103条精选相关主题产品更新论文研究开源生态

最新精选

第 81–100 条 · 共 103 条
9月12日周四
8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

7月23日周二
7月18日周四
  1. Mistral AI82

    Mistral 联合 NVIDIA 发布 12B 开源模型 Mistral NeMo

    Mistral 联合 NVIDIA 发布 Mistral NeMo,这是一款 12B 参数的开源模型,支持 128k 上下文窗口,在推理、世界知识和编码方面表现优异。该模型采用 Apache 2.0 协议,支持 FP8 推理且无性能损失,并内置了更高效的 Tekken tokenizer。

    推荐理由:12B 模型在同等规模下表现优异,且支持 FP8 推理,为开发者提供了高性价比的开源替代方案。

5月24日周五
  1. Hugging Face Blog67

    TII 发布 Falcon 2 11B 语言模型与多模态模型

    TII 发布 Falcon 2 系列模型,包含 11B 参数语言模型与视觉语言模型(VLM),均在 5000B tokens 数据上训练。11B LLM 在多项基准上超越 Llama3-8B 和 Mistral-7B,支持 11 种语言;11B VLM 集成 CLIP 视觉编码器,在 MME 等基准上表现优异。模型采用 Apache 2.0 衍生许可开源。

    推荐理由:Falcon 2 提供 11B 参数语言模型与视觉语言模型,兼顾多语言与代码能力,为端侧部署提供高性价比选择。

5月13日周一
4月18日周四
  1. Hugging Face Blog92

    Hugging Face 发布 Llama 3 模型及生态集成指南

    Hugging Face 宣布 Meta 开源大模型 Llama 3 正式上架,提供 8B 和 70B 两种参数规模及基础与指令微调版本,并同步发布安全模型 Llama Guard 2。文章详细介绍了 Llama 3 在训练数据、上下文窗口和 Tokenizer 方面的升级,并给出了基于 Transformers 进行推理、量化部署及 TRL 微调的具体代码示例。

    推荐理由:Hugging Face 提供了从模型下载、量化部署到微调的完整技术路径,帮助开发者快速接入 Llama 3。

2月28日周三
  1. Hugging Face Blog73

    BigCode 发布 StarCoder2 模型及 The Stack v2 数据集

    BigCode 发布 StarCoder2 系列开源代码大模型,包含 3B、7B 和 15B 三种参数规模。旗舰版 StarCoder2-15B 基于 4 万亿 tokens 的 The Stack v2 数据集训练,在多项评测中表现匹敌 33B 级别模型。同时开源了 The Stack v2 数据集及全部训练代码。

    推荐理由:StarCoder2 提供 3B 至 15B 三种尺寸,15B 模型在多项评测中匹敌 33B 级别模型,为开发者提供了高效的开源代码生成选择。

2月26日周一
  1. Mistral AI85

    Mistral 发布旗舰模型 Mistral Large 及轻量模型 Mistral Small

    Mistral AI 发布最新旗舰语言模型 Mistral Large,该模型原生支持英法西德意五语,具备 32K 上下文窗口、函数调用及 JSON 格式输出能力,在 MMLU 等基准测试中表现优异,并可通过 Azure 获取。同时发布针对低延迟优化的 Mistral Small 模型,两者均支持函数调用与结构化输出功能。

    推荐理由:Mistral 发布旗舰模型并公布多项基准测试成绩,同时推出轻量模型与 API 功能,便于开发者评估选型。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

9月27日周三
  1. Mistral AI85

    Mistral AI 发布 Mistral 7B 模型

    Mistral AI 发布 Mistral 7B 模型,在多项英文及代码基准上超越 13B 参数模型,以 Apache 2.0 协议开源。该模型推理速度快、成本低,适用于摘要、问答等任务。

    推荐理由:Mistral 7B 在多项基准上超越 13B 模型,Apache 2.0 开源,为端侧部署提供高性能替代方案。

9月6日周三
  1. Hugging Face Blog83

    Hugging Face 上线 Falcon 180B 开源大模型

    Hugging Face 上线了 TII 发布的 180B 参数开源大语言模型 Falcon 180B,该模型在 3.5 万亿 token 上预训练,性能对标 PaLM-2 Large。文章提供了 Transformers 集成代码、量化部署方案及硬件需求参考。

    推荐理由:Hugging Face 上线了 180B 参数开源模型,提供了量化部署指南与硬件需求,方便开发者评估与接入。

8月25日周五
  1. Hugging Face Blog86

    Meta 发布 Code Llama 代码大模型系列

    Meta 发布 Code Llama 系列模型,包含 7B、13B 和 34B 参数版本,基于 Llama 2 在 5000 亿代码 Token 上训练。模型支持代码补全、上下文填充及指令微调,上下文窗口可扩展至 10 万 Token。Hugging Face 提供 Transformers 集成、4-bit 量化加载及生产级推理部署方案。

    推荐理由:Meta 发布 Code Llama 系列模型,提供代码补全、生成与指令微调能力,并给出详细的部署与量化指南。

8月22日周二
  1. Hugging Face Blog72

    Hugging Face 开源 IDEFICS 多模态模型,复现 DeepMind Flamingo 能力

    Hugging Face 发布开源多模态模型 IDEFICS,复现 DeepMind 未公开的 Flamingo 架构,支持任意图文序列输入并生成文本。模型提供 9B 和 80B 两种参数规模,以及针对对话场景微调的指令版本,基于 LLaMA v1 和 OpenCLIP 构建,使用公开数据及自研 OBELICS 数据集训练。

    推荐理由:开源复现 DeepMind Flamingo 架构,提供 9B 和 80B 两种参数规模及指令微调版,支持图文序列输入。

7月18日周二
  1. Hugging Face Blog95

    Meta发布Llama 2开源大模型家族

    Meta发布Llama 2开源大模型家族,包含7B、13B和70B参数量的预训练及对话微调模型,采用宽松许可允许商用。Hugging Face提供完整集成支持,包括Transformers推理、Inference Endpoints部署及基于PEFT的单卡微调方案。

    推荐理由:Meta发布Llama 2并提供Hugging Face集成与微调指南,为开源替代闭源模型提供了具体路径。