跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

147条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–140 条 · 共 147 条
3月20日周三
  1. Hugging Face Blog80

    Hugging Face 开源 Cosmopedia 合成数据集及生成工具

    Hugging Face 发布 Cosmopedia,这是目前最大的开源合成数据集,包含250亿token和3000万个文件,由 Mixtral-8x7B-Instruct-v0.1 生成。Hugging Face 开源了端到端生成代码、数据集以及基于此训练的 1B 模型 cosmo-1b,详细披露了通过提示词工程和 Web 数据聚类构建大规模预训练数据的完整技术栈。

    推荐理由:开源了250亿token合成数据及生成代码,为复现Phi模型提供了可迁移的预训练数据构建方案。

2月28日周三
  1. Hugging Face Blog73

    BigCode 发布 StarCoder2 模型及 The Stack v2 数据集

    BigCode 发布 StarCoder2 系列开源代码大模型,包含 3B、7B 和 15B 三种参数规模。旗舰版 StarCoder2-15B 基于 4 万亿 tokens 的 The Stack v2 数据集训练,在多项评测中表现匹敌 33B 级别模型。同时开源了 The Stack v2 数据集及全部训练代码。

    推荐理由:StarCoder2 提供 3B 至 15B 三种尺寸,15B 模型在多项评测中匹敌 33B 级别模型,为开发者提供了高效的开源代码生成选择。

2月23日周五
2月21日周三
2月3日周六
  1. Hugging Face Blog68

    SegMoE:开源扩散模型混合专家框架与预训练模型

    SegMoE 开源了将多个扩散模型合并为混合专家(MoE)架构的代码与预训练模型,支持 diffusers 并集成于 Hugging Face Hub。该框架通过稀疏 MoE 层替换部分前馈层,发布了 SegMoE-4x2 等版本,旨在结合多个专家模型的优势以提升提示词理解能力。

    推荐理由:开源了将多个扩散模型合并为MoE架构的代码与预训练模型,为社区提供了构建高性能图像生成模型的新工具。

2月1日周四
  1. Hugging Face Blog80

    Hugging Face 发布开源模型 Constitutional AI 对齐教程与工具

    Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。

    推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。

1月24日周三
1月4日周四
  1. Hugging Face Blog66

    Hugging Face 开源非扩散图像生成模型 aMUSEd

    Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。

    推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。

9月29日周五
  1. Hugging Face Blog66

    TRL 库集成 DDPO 训练器,支持微调 Stable Diffusion 对齐人类审美

    Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。

    推荐理由:TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。

9月27日周三
  1. Mistral AI85

    Mistral AI 发布 Mistral 7B 模型

    Mistral AI 发布 Mistral 7B 模型,在多项英文及代码基准上超越 13B 参数模型,以 Apache 2.0 协议开源。该模型推理速度快、成本低,适用于摘要、问答等任务。

    推荐理由:Mistral 7B 在多项基准上超越 13B 模型,Apache 2.0 开源,为端侧部署提供高性能替代方案。

  2. Mistral AI90

    Mistral AI 发布 Mistral 7B 开源模型

    Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。

    推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。

9月13日周三
  1. Hugging Face Blog72

    Hugging Face 发布高效图像生成模型 Würstchen

    Hugging Face 发布高效图像生成模型 Würstchen,通过42倍空间压缩实现比 SDXL 更快的推理速度与更低的显存占用。该模型在 Diffusers 库中集成,支持 PyTorch 2.0 SDPA 加速与 torch.compile 优化,并提供多种显存节省策略。

    推荐理由:通过42倍极端压缩显著降低训练与推理成本,为资源受限场景提供高效图像生成方案。

8月25日周五
  1. Hugging Face Blog86

    Meta 发布 Code Llama 代码大模型系列

    Meta 发布 Code Llama 系列模型,包含 7B、13B 和 34B 参数版本,基于 Llama 2 在 5000 亿代码 Token 上训练。模型支持代码补全、上下文填充及指令微调,上下文窗口可扩展至 10 万 Token。Hugging Face 提供 Transformers 集成、4-bit 量化加载及生产级推理部署方案。

    推荐理由:Meta 发布 Code Llama 系列模型,提供代码补全、生成与指令微调能力,并给出详细的部署与量化指南。

8月22日周二
  1. Hugging Face Blog72

    Hugging Face 开源 IDEFICS 多模态模型,复现 DeepMind Flamingo 能力

    Hugging Face 发布开源多模态模型 IDEFICS,复现 DeepMind 未公开的 Flamingo 架构,支持任意图文序列输入并生成文本。模型提供 9B 和 80B 两种参数规模,以及针对对话场景微调的指令版本,基于 LLaMA v1 和 OpenCLIP 构建,使用公开数据及自研 OBELICS 数据集训练。

    推荐理由:开源复现 DeepMind Flamingo 架构,提供 9B 和 80B 两种参数规模及指令微调版,支持图文序列输入。

8月8日周二
  1. Hugging Face Blog73

    使用TRL库通过DPO微调Llama 2

    Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。

    推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。

7月18日周二
  1. Hugging Face Blog95

    Meta发布Llama 2开源大模型家族

    Meta发布Llama 2开源大模型家族,包含7B、13B和70B参数量的预训练及对话微调模型,采用宽松许可允许商用。Hugging Face提供完整集成支持,包括Transformers推理、Inference Endpoints部署及基于PEFT的单卡微调方案。

    推荐理由:Meta发布Llama 2并提供Hugging Face集成与微调指南,为开源替代闭源模型提供了具体路径。

7月17日周一
6月23日周五
  1. Hugging Face Blog70

    Open LLM Leaderboard MMLU 评估差异解析

    Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。

    推荐理由:原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。

6月5日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Falcon 开源大语言模型

    阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。

    推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。

5月15日周一
  1. Hugging Face Blog70

    RWKV架构正式集成至Hugging Face transformers库

    Hugging Face宣布将RWKV架构正式集成至transformers库,该架构结合了RNN的推理效率与Transformer的训练优势。目前提供169M至14B参数的预训练模型及RWKV-4 Raven对话模型,并附带权重转换脚本。

    推荐理由:RWKV架构正式集成至Hugging Face transformers库,提供从预训练到Chat微调的多种模型及权重转换工具。