Hugging Face 开源文本生成与大语言模型生态概览
Hugging Face 发布文章梳理开源文本生成与大语言模型生态。Llama 2 在多项基准测试中超越其他开源模型,BLOOM 参数量超 GPT-3,StarCoder 专注代码补全。开源模型助力企业保护数据、降低成本并适配特定领域。
Hugging Face 发布文章梳理开源文本生成与大语言模型生态。Llama 2 在多项基准测试中超越其他开源模型,BLOOM 参数量超 GPT-3,StarCoder 专注代码补全。开源模型助力企业保护数据、降低成本并适配特定领域。
Hugging Face 展示了如何在 Intel Sapphire Rapids CPU 集群上微调 Stable Diffusion 模型。通过利用 AMX 硬件加速、oneCCL 和 Intel Extension for PyTorch (IPEX),结合 textual inversion 技术,仅需少量示例图片即可完成训练。
本文介绍利用 Node.js 和 Hugging Face Inference Endpoints API 构建 Web 应用生成器的教程。以 WizardCoder-15B 模型为例,通过流式传输 HTML 内容实现文本到网页的生成。文章详细讲解了项目初始化、API 配置、提示词优化及防止模型幻觉的方法。
Writer 联合创始人兼 CTO Waseem Alshikh 分享了公司从 Hugging Face 用户转变为开源模型贡献者的历程。Writer 探讨了生成式 AI 的常见误解,并介绍了 Hugging Face Expert Acceleration Program 对其业务的价值。此外,文章还讨论了在 CPU 和 GPU 上大规模服务 LLM 的生产方法以及效率的重要性。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 模型,相比 Nvidia A10 A100 实现 2.5 倍加速,相比 H100 实现 1.4 倍加速。该性能提升依赖于硬件加速的数据加载技术,通过增加 dataloader_num_workers 有效缓解了图像解码与增强带来的 CPU 瓶颈。
Hugging Face 向美国商务部 NTIA 提交关于人工智能问责政策的回复,强调文档与透明度规范在推动问责中的核心作用。Hugging Face 建议问责机制应覆盖机器学习开发全流程,结合内部规范与外部透明访问,并邀请开发者、研究人员及政策制定者等广泛利益相关方参与。
Autoformer 模型现已在 🤗 Transformers 库中提供。该模型通过分解层和自相关机制,在 Traffic、Exchange-Rate 和 Electricity 数据集上的 MASE 指标均优于 DLinear 模型。
Livebook 笔记本现可直接部署为 Hugging Face Spaces 应用。该集成支持通过 Whisper 模型构建多人语音聊天应用,并实现并发模型服务。用户可借助 Bumblebee 和 tokenizers 等库,在 Spaces 中免费运行交互式代码笔记本。
Hugging Face 发布新版内容政策,旨在维护开放、协作且负责任的机器学习社区环境。新规强调“同意”为核心价值,规范用户身份与隐私保护,并禁止针对用户及员工的攻击性语言。平台鼓励通过社区标签页进行透明讨论与协作,以解决潜在冲突。
Hugging Face 发布研究,对比人类标注与 GPT-4 对开源模型(Vicuna、Koala 等)的偏好评估,发现 GPT-4 存在显著的位置偏差和长度偏好,且与人类标注的相关性在编码任务中较低。
推荐理由:通过对比人类标注与GPT-4评估结果,揭示了LLM评估中的位置偏差与长度偏好问题。
Hugging Face Hub 面向画廊、图书馆、档案馆和博物馆(GLAM)领域发布应用指南,介绍如何利用该平台共享和访问机器学习模型、数据集及演示应用。平台目前托管超过 19 万个模型、3.3 万个数据集和 10 万个应用,支持通过 API 部署或集成 Transformers 库使用。文章详细演示了如何筛选特定任务与语言的模型,以及如何上传 CSV 格式的数据集。
Hugging Face Hub 新增功能,允许用户通过 DuckDB 对平台上存储的 50,000 多个数据集运行 SQL 查询。Dataset Viewer 会自动将公开数据集转换为 Parquet 文件,用户可通过 HTTP 调用获取文件 URL,并利用 DuckDB 的 httpfs 扩展直接对远程文件执行分析查询。
Hugging Face Hub 上线 Meta AI fastText 官方镜像,托管 157 种语言词向量及语言识别模型。用户可通过 huggingface_hub 库轻松下载模型,并利用内置的文本分类和特征提取小部件进行交互。
阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
Hugging Face 发布 Unity API 语音识别教程,指导开发者在 Unity 游戏中实现语音转文本功能。教程详细演示了如何设置 UI 组件、编写 C# 脚本调用麦克风录制音频,并将 WAV 格式数据通过 API 处理。该功能可用于 NPC 交互、游戏指令控制及无障碍辅助。
Hugging Face 宣布举办首届开源 AI 游戏开发大赛,参赛者需在 7 月 7 日至 9 日期间使用 AI 工具制作游戏。参赛作品需支持网页或 Windows 平台,且必须集成至少一个开源 AI 工具。比赛强调利用 Stable Diffusion 等工具加速开发,面向全球开发者免费开放。
Hugging Face Hub 正式集成 BERTopic,为模型和数据集提供自动主题建模功能。该工具支持对文本数据进行聚类与可视化,帮助开发者快速理解语料库结构。集成后用户可直接在 Hub 上利用该算法进行主题分析。
Hugging Face 与微软合作在 Azure Machine Learning Studio 原生集成 Hugging Face Model Catalog,提供数千个热门 Transformers 模型。用户可通过几步操作在 Azure 基础设施上快速部署模型并获取推理 API。该服务今日在 Azure 所有可用区域以公共预览版形式开放。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。
推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。
Hugging Face 与 IBM 宣布合作,将 Hugging Face 开源库集成至 IBM watsonx.ai 平台。watsonx.ai 是基于 RedHat OpenShift 构建的下一代企业 AI 工作室,支持在云端和本地部署,旨在帮助客户训练、验证、微调及部署传统机器学习与生成式 AI 模型。双方还将合作将 IBM 开发的大语言模型开源至 Hugging Face Hub。
Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。
BigCode 团队分享了大规模近重复数据去重的实践经验,旨在提升代码模型训练效率并防止基准测试污染。文章详细解析了 MinHash + LSH 等去重方法,并提供了针对 InCoder、CodeGen 等模型及 The Stack 数据集的去重参数与效果对比数据。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。
推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。
Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。
推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。
文本生成视频模型正成为生成式AI的重要进展,旨在从文本描述中生成时空一致的视频序列。该任务面临计算成本高、高质量数据集稀缺及视频描述模糊等独特挑战。Hugging Face 博客回顾了从 GAN 到 Transformer 再到扩散模型的演进,并分享了相关演示与资源。
Hugging Face 发布 StarCoder 和 StarCoderBase 代码大语言模型,在 HumanEval 等基准上达到开源 SOTA。模型基于 The Stack 数据集训练,提供完整训练数据、PII 移除工具及 BigCode OpenRAIL-M 许可证。
推荐理由:模型在HumanEval等基准上达到开源SOTA,提供完整训练数据与治理工具,适合二次开发。
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face 发布指南,展示如何使用 🤗 Transformers、TensorFlow 和 TPU 从头训练 RoBERTa 模型。教程涵盖使用 🤗 tokenizers 训练 Unigram 分词器、将 WikiText 数据集转换为 TFRecord 格式并上传至 Google Cloud Storage,以及利用 XLA 兼容性完成端到端训练流程。
Hugging Face 发布首个官方 Spark 支持,允许用户通过 `from_spark` 函数直接将 Apache Spark dataframe 转换为 Hugging Face Dataset。该功能省去了写入 Parquet 文件的繁琐步骤,使 16GB 数据集的处理时间从 22 分钟缩短至 12 分钟,训练和微调速度提升超过 40%。
Hugging Face 推出面向中文用户的官方博客 hf.co/blog/zh,由志愿者翻译博客文章及 Transformer、扩散模型和强化学习课程。此举旨在服务日益增长的中文 AI 社区,促进相互学习与协作。Hugging Face 将加强与 PaddlePaddle 等组织的合作,并继续举办线上课程及线下活动以推动开源机器学习领域的知识共享。
Snorkel AI 与 Hugging Face 合作,通过 Snorkel Flow 平台集成 Hugging Face Inference Endpoint 服务,帮助企业更灵活地适配基础模型。
Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。
推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。
Hugging Face 发布伦理与社会通讯第 3 期,阐述在开源机器学习中平衡开放性与风险控制的伦理框架。平台推出涵盖严谨、同意、社会意识等 6 个维度的伦理标签,并上线内容举报功能以识别违规模型与数据集。此外,Hugging Face 通过完善模型卡片、推广 RAIL 许可证及社区协作机制,致力于最小化 AI 潜在危害。
在 Intel Sapphire Rapids CPU 上,使用 OpenVINO 将 Stable Diffusion 推理延迟从 32.3 秒降至 16.7 秒,实现 2 倍加速。进一步通过 reshape 固定输入形状,延迟可进一步降至 4.7 秒,带来额外 3.5 倍加速。结合系统级优化,相比上代 Ice Lake CPU 原生推理,整体速度提升近 10 倍。
BLOOMZ 模型在 Habana Gaudi2 加速器上实现了比 Nvidia A100 更快的推理速度。176B 参数模型在 Gaudi2 上比 A100 快 1.42 倍,7B 参数模型快 2.89 倍。初代 Gaudi 在 7B 模型上具备更优的性价比。
Hugging Face 发布教程展示如何结合 Flower 框架在多个客户端上对 distilBERT 模型进行联邦学习。该教程以 IMDB 数据集为例,演示了利用 Hugging Face datasets 库加载数据、使用 PyTorch 进行模型训练与评估,并通过 Flower 客户端类实现本地训练与参数聚合的完整流程。
Hugging Face 博客详解了使用 diffusers 训练 ControlNet 的三步流程:规划条件、构建数据集与模型训练。文章以训练面部姿态控制模型为例,展示了从 FaceSynthetics 数据集准备到使用 A100 进行训练的具体代码与参数配置,并提供了适配 8GB 至 16GB 显存的优化方案。
推荐理由:原文详述了基于diffusers训练ControlNet的三步流程与显存优化技巧,提供了可直接复用的实操指南。
Hugging Face 改进了 Hugging Face Hub 对 Jupyter 笔记本的托管支持,新增渲染功能使 ipynb 文件以人类可读格式展示。Hub 现已支持一键将托管笔记本直接打开在 Google Colab 中。此举旨在提升模型、数据集及演示资源的可复现性与使用便利性。
Hugging Face 发布 Informer 模型,支持多元概率时间序列预测任务。该模型基于 Transformer 架构,通过 ProbSparse 注意力机制和 Distilling 操作,将计算复杂度从 O(T^2D) 降低至 O(TlogT)。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。