跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

150条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 141–150 条 · 共 150 条
6月23日周五
  1. Hugging Face Blog70

    Open LLM Leaderboard MMLU 评估差异解析

    Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。

    推荐理由:原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。

6月5日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Falcon 开源大语言模型

    阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。

    推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。

5月15日周一
  1. Hugging Face Blog70

    RWKV架构正式集成至Hugging Face transformers库

    Hugging Face宣布将RWKV架构正式集成至transformers库,该架构结合了RNN的推理效率与Transformer的训练优势。目前提供169M至14B参数的预训练模型及RWKV-4 Raven对话模型,并附带权重转换脚本。

    推荐理由:RWKV架构正式集成至Hugging Face transformers库,提供从预训练到Chat微调的多种模型及权重转换工具。

5月9日周二
  1. Hugging Face Blog73

    Hugging Face 发布 StarChat Alpha 编程助手

    Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。

    推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。

5月4日周四
  1. Hugging Face Blog82

    StarCoder 发布:面向代码的大语言模型

    Hugging Face 发布 StarCoder 和 StarCoderBase 代码大语言模型,在 HumanEval 等基准上达到开源 SOTA。模型基于 The Stack 数据集训练,提供完整训练数据、PII 移除工具及 BigCode OpenRAIL-M 许可证。

    推荐理由:模型在HumanEval等基准上达到开源SOTA,提供完整训练数据与治理工具,适合二次开发。

3月9日周四
2月10日周五
  1. Hugging Face Blog81

    Hugging Face 发布 PEFT 高效微调库

    Hugging Face 发布 PEFT 库,无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning 等方法。通过仅微调少量参数,可在消费级硬件上高效微调大模型,大幅降低存储与算力成本。

    推荐理由:官方发布高效微调库,支持LoRA等技术在消费级硬件上微调大模型,显著降低存储与算力成本。

9月26日周一
9月21日周三
7月12日周二
  1. Hugging Face Blog77

    Hugging Face 发布全球最大开源多语言大模型 BLOOM

    Hugging Face 发布全球最大开源多语言大语言模型 BLOOM,拥有 1760 亿参数,支持 46 种自然语言和 13 种编程语言。该模型由 1000 多名研究人员历时 117 天训练完成,首次开源了完整的训练检查点和优化器状态,并提供基于 TPU 的推理 API 供社区测试。

    推荐理由:开源了1760亿参数多语言模型及训练检查点,为研究大模型内部机制提供了完整的透明数据。