Hugging Face 发布 Falcon 开源大语言模型
阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
Hugging Face 发布 Unity API 语音识别教程,指导开发者在 Unity 游戏中实现语音转文本功能。教程详细演示了如何设置 UI 组件、编写 C# 脚本调用麦克风录制音频,并将 WAV 格式数据通过 API 处理。该功能可用于 NPC 交互、游戏指令控制及无障碍辅助。
Hugging Face 宣布举办首届开源 AI 游戏开发大赛,参赛者需在 7 月 7 日至 9 日期间使用 AI 工具制作游戏。参赛作品需支持网页或 Windows 平台,且必须集成至少一个开源 AI 工具。比赛强调利用 Stable Diffusion 等工具加速开发,面向全球开发者免费开放。
Hugging Face Hub 正式集成 BERTopic,为模型和数据集提供自动主题建模功能。该工具支持对文本数据进行聚类与可视化,帮助开发者快速理解语料库结构。集成后用户可直接在 Hub 上利用该算法进行主题分析。
Hugging Face 博客介绍了一种结合 OpenVINO NNCF 和 🤗 Optimum 的优化工作流,显著降低了 Stable Diffusion 模型在资源受限 CPU 上的推理延迟。该方案通过量化感知训练(QAT)、知识蒸馏和 Token Merging 技术,实现了 5.1 倍的推理加速和 4 倍的模型体积缩减。
Hugging Face 与微软合作在 Azure Machine Learning Studio 原生集成 Hugging Face Model Catalog,提供数千个热门 Transformers 模型。用户可通过几步操作在 Azure 基础设施上快速部署模型并获取推理 API。该服务今日在 Azure 所有可用区域以公共预览版形式开放。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。
推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。
Hugging Face 与 IBM 宣布合作,将 Hugging Face 开源库集成至 IBM watsonx.ai 平台。watsonx.ai 是基于 RedHat OpenShift 构建的下一代企业 AI 工作室,支持在云端和本地部署,旨在帮助客户训练、验证、微调及部署传统机器学习与生成式 AI 模型。双方还将合作将 IBM 开发的大语言模型开源至 Hugging Face Hub。
Hugging Face 博客介绍利用 InstructPix2Pix 训练方法对 Stable Diffusion 进行指令微调,使其能根据指令处理输入图像。研究结合 FLAN V2 理念构建数据集,在卡通化、去雨等任务上实现了比预训练模型更忠实的效果。代码、预训练模型及数据集已开源。
Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。
BigCode 团队分享了大规模近重复数据去重的实践经验,旨在提升代码模型训练效率并防止基准测试污染。文章详细解析了 MinHash + LSH 等去重方法,并提供了针对 InCoder、CodeGen 等模型及 The Stack 数据集的去重参数与效果对比数据。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。
推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。
Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。
推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。
文本生成视频模型正成为生成式AI的重要进展,旨在从文本描述中生成时空一致的视频序列。该任务面临计算成本高、高质量数据集稀缺及视频描述模糊等独特挑战。Hugging Face 博客回顾了从 GAN 到 Transformer 再到扩散模型的演进,并分享了相关演示与资源。
Hugging Face 发布 StarCoder 和 StarCoderBase 代码大语言模型,在 HumanEval 等基准上达到开源 SOTA。模型基于 The Stack 数据集训练,提供完整训练数据、PII 移除工具及 BigCode OpenRAIL-M 许可证。
推荐理由:模型在HumanEval等基准上达到开源SOTA,提供完整训练数据与治理工具,适合二次开发。
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face 发布指南,展示如何使用 🤗 Transformers、TensorFlow 和 TPU 从头训练 RoBERTa 模型。教程涵盖使用 🤗 tokenizers 训练 Unigram 分词器、将 WikiText 数据集转换为 TFRecord 格式并上传至 Google Cloud Storage,以及利用 XLA 兼容性完成端到端训练流程。
Hugging Face 发布首个官方 Spark 支持,允许用户通过 `from_spark` 函数直接将 Apache Spark dataframe 转换为 Hugging Face Dataset。该功能省去了写入 Parquet 文件的繁琐步骤,使 16GB 数据集的处理时间从 22 分钟缩短至 12 分钟,训练和微调速度提升超过 40%。
Hugging Face 推出面向中文用户的官方博客 hf.co/blog/zh,由志愿者翻译博客文章及 Transformer、扩散模型和强化学习课程。此举旨在服务日益增长的中文 AI 社区,促进相互学习与协作。Hugging Face 将加强与 PaddlePaddle 等组织的合作,并继续举办线上课程及线下活动以推动开源机器学习领域的知识共享。
Snorkel AI 与 Hugging Face 合作,通过 Snorkel Flow 平台集成 Hugging Face Inference Endpoint 服务,帮助企业更灵活地适配基础模型。
Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。
推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。
Hugging Face 发布伦理与社会通讯第 3 期,阐述在开源机器学习中平衡开放性与风险控制的伦理框架。平台推出涵盖严谨、同意、社会意识等 6 个维度的伦理标签,并上线内容举报功能以识别违规模型与数据集。此外,Hugging Face 通过完善模型卡片、推广 RAIL 许可证及社区协作机制,致力于最小化 AI 潜在危害。
在 Intel Sapphire Rapids CPU 上,使用 OpenVINO 将 Stable Diffusion 推理延迟从 32.3 秒降至 16.7 秒,实现 2 倍加速。进一步通过 reshape 固定输入形状,延迟可进一步降至 4.7 秒,带来额外 3.5 倍加速。结合系统级优化,相比上代 Ice Lake CPU 原生推理,整体速度提升近 10 倍。
BLOOMZ 模型在 Habana Gaudi2 加速器上实现了比 Nvidia A100 更快的推理速度。176B 参数模型在 Gaudi2 上比 A100 快 1.42 倍,7B 参数模型快 2.89 倍。初代 Gaudi 在 7B 模型上具备更优的性价比。
Hugging Face 发布教程展示如何结合 Flower 框架在多个客户端上对 distilBERT 模型进行联邦学习。该教程以 IMDB 数据集为例,演示了利用 Hugging Face datasets 库加载数据、使用 PyTorch 进行模型训练与评估,并通过 Flower 客户端类实现本地训练与参数聚合的完整流程。
Hugging Face 博客详解了使用 diffusers 训练 ControlNet 的三步流程:规划条件、构建数据集与模型训练。文章以训练面部姿态控制模型为例,展示了从 FaceSynthetics 数据集准备到使用 A100 进行训练的具体代码与参数配置,并提供了适配 8GB 至 16GB 显存的优化方案。
推荐理由:原文详述了基于diffusers训练ControlNet的三步流程与显存优化技巧,提供了可直接复用的实操指南。
Hugging Face 改进了 Hugging Face Hub 对 Jupyter 笔记本的托管支持,新增渲染功能使 ipynb 文件以人类可读格式展示。Hub 现已支持一键将托管笔记本直接打开在 Google Colab 中。此举旨在提升模型、数据集及演示资源的可复现性与使用便利性。
Hugging Face 发布 Informer 模型,支持多元概率时间序列预测任务。该模型基于 Transformer 架构,通过 ProbSparse 注意力机制和 Distilling 操作,将计算复杂度从 O(T^2D) 降低至 O(TlogT)。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Kakao Brain 与 Hugging Face 联合发布首个开源 ALIGN 模型及 7 亿图文对 COYO 数据集。该模型在多项任务上表现媲美 Google 原版,且训练数据完全公开,支持零样本图像分类与多模态嵌入提取。
Hugging Face 发布教程介绍如何在 Diffusers 中使用 StableDiffusionControlNetPipeline,涵盖边缘、姿态等多种条件控制及多条件组合方法,并演示了通过优化调度器、CPU卸载和xformers实现推理加速与显存节省。
推荐理由:文章详细演示了Diffusers中ControlNet的集成与优化技巧,提供可复用的代码与性能调优方案。
志愿者团队利用 Hugging Face 平台构建 afetharita 应用,协助土耳其地震搜救。团队使用 easyocr 和微调后的 bert-base-turkish-cased 模型提取幸存者信息,并通过 Inference API 部署模型。此外,团队利用 NLI 模型和 Argilla 标注界面优化需求分类与实体识别,确保数据准确入库。
Hugging Face 专家加速项目协助 Witty Works 开发包容性写作助手,解决上下文依赖词汇检测难题。团队采用 Sentence Transformers 架构结合 SetFit 库,仅需 15-20 条标注样本即可完成微调。最终部署 mpnet-base-v2 模型,实现低延迟实时建议。
Hugging Face 发布 Diffusers for Mac 1.1,将扩散模型转换为 Core ML 以利用 Apple Silicon 硬件加速。性能测试显示 M1 Max 使用 GPU 最快,标准 M1 使用 ANE 更快,新版本会自动选择最佳加速器。
推荐理由:官方发布 Swift 原生应用并给出多芯片性能数据,可据此判断端侧生成效率。
Fetch 利用 Hugging Face 和 AWS 构建自有 AI 工具,将开发时间缩短 30%。该方案处理超过 1100 万张收据,处理延迟降低 50%。
我们已将部分机器学习推理模型从 AWS ECS 迁移至 Hugging Face Inference Endpoints,以简化部署流程并降低认知负荷。测试显示,Hugging Face 的 RoBERTa 微调模型在大型实例上的延迟低至 80ms,比 ECS 方案快两倍以上。虽然成本增加了 24% 至 50%,但节省的运维时间远超差价。
Salesforce Research 发布的 BLIP-2 模型现已集成至 Hugging Face Transformers,支持图像描述、提示词图像描述、视觉问答及基于聊天的提示。该模型通过轻量级 Q-Former 桥接视觉与语言模型,仅需微调该组件即可利用冻结的预训练视觉编码器和 LLM,显著降低训练成本。
SpeechT5 正式集成至 Hugging Face Transformers,该模型支持语音合成、自动语音识别及语音转换。其基于 Transformer 编码器-解码器架构,通过预训练共享文本与语音的隐藏表示空间。用户可通过安装 GitHub 版本并加载 `microsoft/speecht5_tts` 模型进行文本到语音的生成。
本文介绍利用 ChatGPT 为农场游戏生成故事内容的方法与限制。语言模型易复制现有故事并产生重复,直接商用存在法律与伦理风险。建议将 AI 用于构思大纲或细节补充,最终内容需人工撰写以确保原创性。
Hugging Face 推出 AI vs. AI 深度强化学习多智能体竞赛系统,通过 ELO 评分机制对提交至 Hub 的模型进行相对实力排名。该系统利用 Spaces 运行匹配算法并生成排行榜,首个挑战为 SoccerTwos Challenge。