如何在 Unity 项目中安装和使用 Hugging Face Unity API
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face 发布指南,展示如何使用 🤗 Transformers、TensorFlow 和 TPU 从头训练 RoBERTa 模型。教程涵盖使用 🤗 tokenizers 训练 Unigram 分词器、将 WikiText 数据集转换为 TFRecord 格式并上传至 Google Cloud Storage,以及利用 XLA 兼容性完成端到端训练流程。
Hugging Face 发布首个官方 Spark 支持,允许用户通过 `from_spark` 函数直接将 Apache Spark dataframe 转换为 Hugging Face Dataset。该功能省去了写入 Parquet 文件的繁琐步骤,使 16GB 数据集的处理时间从 22 分钟缩短至 12 分钟,训练和微调速度提升超过 40%。
Hugging Face 推出面向中文用户的官方博客 hf.co/blog/zh,由志愿者翻译博客文章及 Transformer、扩散模型和强化学习课程。此举旨在服务日益增长的中文 AI 社区,促进相互学习与协作。Hugging Face 将加强与 PaddlePaddle 等组织的合作,并继续举办线上课程及线下活动以推动开源机器学习领域的知识共享。
Snorkel AI 与 Hugging Face 合作,通过 Snorkel Flow 平台集成 Hugging Face Inference Endpoint 服务,帮助企业更灵活地适配基础模型。
Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。
推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。
Hugging Face 发布伦理与社会通讯第 3 期,阐述在开源机器学习中平衡开放性与风险控制的伦理框架。平台推出涵盖严谨、同意、社会意识等 6 个维度的伦理标签,并上线内容举报功能以识别违规模型与数据集。此外,Hugging Face 通过完善模型卡片、推广 RAIL 许可证及社区协作机制,致力于最小化 AI 潜在危害。
在 Intel Sapphire Rapids CPU 上,使用 OpenVINO 将 Stable Diffusion 推理延迟从 32.3 秒降至 16.7 秒,实现 2 倍加速。进一步通过 reshape 固定输入形状,延迟可进一步降至 4.7 秒,带来额外 3.5 倍加速。结合系统级优化,相比上代 Ice Lake CPU 原生推理,整体速度提升近 10 倍。
BLOOMZ 模型在 Habana Gaudi2 加速器上实现了比 Nvidia A100 更快的推理速度。176B 参数模型在 Gaudi2 上比 A100 快 1.42 倍,7B 参数模型快 2.89 倍。初代 Gaudi 在 7B 模型上具备更优的性价比。
Hugging Face 发布教程展示如何结合 Flower 框架在多个客户端上对 distilBERT 模型进行联邦学习。该教程以 IMDB 数据集为例,演示了利用 Hugging Face datasets 库加载数据、使用 PyTorch 进行模型训练与评估,并通过 Flower 客户端类实现本地训练与参数聚合的完整流程。
Hugging Face 博客详解了使用 diffusers 训练 ControlNet 的三步流程:规划条件、构建数据集与模型训练。文章以训练面部姿态控制模型为例,展示了从 FaceSynthetics 数据集准备到使用 A100 进行训练的具体代码与参数配置,并提供了适配 8GB 至 16GB 显存的优化方案。
推荐理由:原文详述了基于diffusers训练ControlNet的三步流程与显存优化技巧,提供了可直接复用的实操指南。
Hugging Face 改进了 Hugging Face Hub 对 Jupyter 笔记本的托管支持,新增渲染功能使 ipynb 文件以人类可读格式展示。Hub 现已支持一键将托管笔记本直接打开在 Google Colab 中。此举旨在提升模型、数据集及演示资源的可复现性与使用便利性。
Hugging Face 发布 Informer 模型,支持多元概率时间序列预测任务。该模型基于 Transformer 架构,通过 ProbSparse 注意力机制和 Distilling 操作,将计算复杂度从 O(T^2D) 降低至 O(TlogT)。
Hugging Face 官方发布 TRL 与 PEFT 的集成,利用 8-bit 量化和 LoRA 适配器,在 24GB 显存的消费级 GPU 上成功微调了 20B 参数的 GPT-NeoX 模型。
推荐理由:官方发布TRL与PEFT集成方案,展示在消费级显卡上微调20B模型的技术路径。
Kakao Brain 与 Hugging Face 联合发布首个开源 ALIGN 模型及 7 亿图文对 COYO 数据集。该模型在多项任务上表现媲美 Google 原版,且训练数据完全公开,支持零样本图像分类与多模态嵌入提取。
Hugging Face 发布教程介绍如何在 Diffusers 中使用 StableDiffusionControlNetPipeline,涵盖边缘、姿态等多种条件控制及多条件组合方法,并演示了通过优化调度器、CPU卸载和xformers实现推理加速与显存节省。
推荐理由:文章详细演示了Diffusers中ControlNet的集成与优化技巧,提供可复用的代码与性能调优方案。
志愿者团队利用 Hugging Face 平台构建 afetharita 应用,协助土耳其地震搜救。团队使用 easyocr 和微调后的 bert-base-turkish-cased 模型提取幸存者信息,并通过 Inference API 部署模型。此外,团队利用 NLI 模型和 Argilla 标注界面优化需求分类与实体识别,确保数据准确入库。
Hugging Face 专家加速项目协助 Witty Works 开发包容性写作助手,解决上下文依赖词汇检测难题。团队采用 Sentence Transformers 架构结合 SetFit 库,仅需 15-20 条标注样本即可完成微调。最终部署 mpnet-base-v2 模型,实现低延迟实时建议。
Hugging Face 发布 Diffusers for Mac 1.1,将扩散模型转换为 Core ML 以利用 Apple Silicon 硬件加速。性能测试显示 M1 Max 使用 GPU 最快,标准 M1 使用 ANE 更快,新版本会自动选择最佳加速器。
推荐理由:官方发布 Swift 原生应用并给出多芯片性能数据,可据此判断端侧生成效率。
Fetch 利用 Hugging Face 和 AWS 构建自有 AI 工具,将开发时间缩短 30%。该方案处理超过 1100 万张收据,处理延迟降低 50%。
我们已将部分机器学习推理模型从 AWS ECS 迁移至 Hugging Face Inference Endpoints,以简化部署流程并降低认知负荷。测试显示,Hugging Face 的 RoBERTa 微调模型在大型实例上的延迟低至 80ms,比 ECS 方案快两倍以上。虽然成本增加了 24% 至 50%,但节省的运维时间远超差价。
Salesforce Research 发布的 BLIP-2 模型现已集成至 Hugging Face Transformers,支持图像描述、提示词图像描述、视觉问答及基于聊天的提示。该模型通过轻量级 Q-Former 桥接视觉与语言模型,仅需微调该组件即可利用冻结的预训练视觉编码器和 LLM,显著降低训练成本。
SpeechT5 正式集成至 Hugging Face Transformers,该模型支持语音合成、自动语音识别及语音转换。其基于 Transformer 编码器-解码器架构,通过预训练共享文本与语音的隐藏表示空间。用户可通过安装 GitHub 版本并加载 `microsoft/speecht5_tts` 模型进行文本到语音的生成。
Hugging Face 推出 AI vs. AI 深度强化学习多智能体竞赛系统,通过 ELO 评分机制对提交至 Hub 的模型进行相对实力排名。该系统利用 Spaces 运行匹配算法并生成排行榜,首个挑战为 SoccerTwos Challenge。
本文测试了基于 Intel Sapphire Rapids 架构的服务器在运行 Hugging Face PyTorch Transformers 推理时的性能。
视觉-语言模型通过结合图像和文本编码器,利用对比学习、PrefixLM、交叉注意力融合及 MLM/ITM 等策略进行预训练,以实现零样本泛化。Hugging Face 博客介绍了这些核心训练方法,并展示了如何利用 🤗 Transformers 库进行实验。
Hugging Face Hub 已支持图像分类、分割等 8 项核心视觉任务,收录超 3000 个模型与 100 个数据集。Transformers 库提供 Pipelines 推理接口及 Trainer 微调 API,并集成 timm、Diffusers 等第三方库。平台还涵盖 CLIP 等零样本模型支持及 ImageNet-1k 等数据集加载指南。
Stable Diffusion 的 Image2Image 功能可作为辅助工具融入传统 2D 工作流,通过调整 denoising strength 参数控制模型对输入图像的创意修改程度。
Hugging Face Diffusers 正式支持 Stable Diffusion 的 LoRA 微调,训练仅需 11 GB 显存,生成的权重文件仅约 3 MB。该功能支持 Dreambooth 和全量微调,并内置自动记录基础模型元数据以简化推理加载。
推荐理由:Diffusers 原生支持 LoRA 大幅降低显存需求并生成极小权重文件,便于模型分享与复用。
文章演示了如何利用Hugging Face Datasets和Transformers库构建图像相似度检索系统。通过加载预训练视觉模型提取图像嵌入向量,并使用余弦相似度计算查询图像与候选图像的匹配度。文中提供了完整的Python代码示例,并介绍了使用FAISS进行高效索引和检索的扩展方法。
本文介绍如何使用 ChatGPT 辅助游戏设计,通过提示词获取关于作物多样性、进度系统和社交功能等核心玩法的建议。文章解析了基于 Transformer 架构和 RLHF 技术的语言模型原理,并指出模型虽能加速头脑风暴,但存在幻觉风险,不应作为确定的知识库。
本文介绍图机器学习的基础知识,涵盖图的定义、表示方法及应用场景。图由节点和边组成,可用于药物发现、推荐系统等任务。文中还简要介绍了图神经网络及基于 Transformer 的图学习方法。
Hugging Face 发布系列教程,展示如何利用 AI 工具在 5 天内开发一款功能完整的农场游戏。教程首日演示使用 Stable Diffusion 1.5 生成等距视角的概念艺术,并指导在 Unity 2021.9.3f1 中搭建场景。该指南面向熟悉 C# 的开发者,涵盖从艺术风格设定到引擎集成的完整工作流。
Hugging Face 发布 Model Card Creator 工具及模型卡指南,旨在降低文档创建门槛并促进跨角色协作。该工具提供图形界面,无需编程即可生成模型卡,并配套更新版模板、带注释的填写指南及用户研究报告。此举旨在通过标准化结构和默认提示文本,提升机器学习模型文档的可访问性与包容性。
Hugging Face Datasets 提供一行 Python 代码即可下载和准备音频数据集的功能。通过 Hub 平台可浏览并试听 Common Voice 等数据集,利用 load_dataset 函数可轻松加载 GigaSpeech 等数据。该工具支持流式模式,简化了音频数据的预处理流程。
Hugging Face 发布《伦理与社会通讯》第2期,探讨机器学习中的偏见问题。文章指出模型作为社会技术系统会放大社会趋势,需通过工具和分析在开发全流程中应对。内容涵盖从任务定义到模型训练各阶段的偏见缓解策略及社区开发的相关工具。
Habana Gaudi2 在模型训练和推理速度上约为 Nvidia A100 80GB 的两倍。在 BERT 预训练中,Gaudi2 相比初代 Gaudi 提速 3.04 倍,相比 A100 提速 1.89 倍。在 Stable Diffusion 推理中,Gaudi2 延迟比 A100 低 2.84 倍,且支持更大批量处理。
Hugging Face 官方提供 Stable Diffusion Core ML 转换权重,让 Apple Silicon 用户能直接调用并本地运行。支持 v1.4、v1.5 及 v2 系列模型,提供 Python 和 Swift 两种推理方式,并附带自定义模型转换脚本。
推荐理由:Hugging Face 官方提供 Stable Diffusion Core ML 转换权重,让 Apple Silicon 用户能直接调用并本地运行。
🤗 Transformers 库内置了 Time Series Transformer 模型,用于单变量时间序列的概率预测。该模型采用 Encoder-Decoder 架构,支持通过祖先采样生成预测分布,并能处理缺失值。文章以澳大利亚旅游数据集为例,演示了如何结合 GluonTS 进行数据预处理与模型训练。
VQ-Diffusion 是由中国科学技术大学和微软开发的条件潜在扩散模型,其噪声和去噪过程在由离散向量组成的量化潜在空间中进行。该模型使用冻结权重的 VQ-VAE 将图像编码为离散 token,并通过预训练的 CLIP 文本编码器和解码器 Transformer 实现条件生成。