使用 NNCF 和 🤗 Optimum 优化 Stable Diffusion 在 Intel CPU 上的性能
Hugging Face 博客介绍了一种结合 OpenVINO NNCF 和 🤗 Optimum 的优化工作流,显著降低了 Stable Diffusion 模型在资源受限 CPU 上的推理延迟。该方案通过量化感知训练(QAT)、知识蒸馏和 Token Merging 技术,实现了 5.1 倍的推理加速和 4 倍的模型体积缩减。
Hugging Face 博客介绍了一种结合 OpenVINO NNCF 和 🤗 Optimum 的优化工作流,显著降低了 Stable Diffusion 模型在资源受限 CPU 上的推理延迟。该方案通过量化感知训练(QAT)、知识蒸馏和 Token Merging 技术,实现了 5.1 倍的推理加速和 4 倍的模型体积缩减。
Hugging Face 博客介绍利用 InstructPix2Pix 训练方法对 Stable Diffusion 进行指令微调,使其能根据指令处理输入图像。研究结合 FLAN V2 理念构建数据集,在卡通化、去雨等任务上实现了比预训练模型更忠实的效果。代码、预训练模型及数据集已开源。
Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。
BigCode 团队分享了大规模近重复数据去重的实践经验,旨在提升代码模型训练效率并防止基准测试污染。文章详细解析了 MinHash + LSH 等去重方法,并提供了针对 InCoder、CodeGen 等模型及 The Stack 数据集的去重参数与效果对比数据。
文本生成视频模型正成为生成式AI的重要进展,旨在从文本描述中生成时空一致的视频序列。该任务面临计算成本高、高质量数据集稀缺及视频描述模糊等独特挑战。Hugging Face 博客回顾了从 GAN 到 Transformer 再到扩散模型的演进,并分享了相关演示与资源。
Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。
Hugging Face 发布指南,展示如何使用 🤗 Transformers、TensorFlow 和 TPU 从头训练 RoBERTa 模型。教程涵盖使用 🤗 tokenizers 训练 Unigram 分词器、将 WikiText 数据集转换为 TFRecord 格式并上传至 Google Cloud Storage,以及利用 XLA 兼容性完成端到端训练流程。
Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。
推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。
在 Intel Sapphire Rapids CPU 上,使用 OpenVINO 将 Stable Diffusion 推理延迟从 32.3 秒降至 16.7 秒,实现 2 倍加速。进一步通过 reshape 固定输入形状,延迟可进一步降至 4.7 秒,带来额外 3.5 倍加速。结合系统级优化,相比上代 Ice Lake CPU 原生推理,整体速度提升近 10 倍。
Hugging Face 发布教程展示如何结合 Flower 框架在多个客户端上对 distilBERT 模型进行联邦学习。该教程以 IMDB 数据集为例,演示了利用 Hugging Face datasets 库加载数据、使用 PyTorch 进行模型训练与评估,并通过 Flower 客户端类实现本地训练与参数聚合的完整流程。
Hugging Face 博客详解了使用 diffusers 训练 ControlNet 的三步流程:规划条件、构建数据集与模型训练。文章以训练面部姿态控制模型为例,展示了从 FaceSynthetics 数据集准备到使用 A100 进行训练的具体代码与参数配置,并提供了适配 8GB 至 16GB 显存的优化方案。
推荐理由:原文详述了基于diffusers训练ControlNet的三步流程与显存优化技巧,提供了可直接复用的实操指南。
Hugging Face 发布 Informer 模型,支持多元概率时间序列预测任务。该模型基于 Transformer 架构,通过 ProbSparse 注意力机制和 Distilling 操作,将计算复杂度从 O(T^2D) 降低至 O(TlogT)。
Hugging Face 发布教程介绍如何在 Diffusers 中使用 StableDiffusionControlNetPipeline,涵盖边缘、姿态等多种条件控制及多条件组合方法,并演示了通过优化调度器、CPU卸载和xformers实现推理加速与显存节省。
推荐理由:文章详细演示了Diffusers中ControlNet的集成与优化技巧,提供可复用的代码与性能调优方案。
志愿者团队利用 Hugging Face 平台构建 afetharita 应用,协助土耳其地震搜救。团队使用 easyocr 和微调后的 bert-base-turkish-cased 模型提取幸存者信息,并通过 Inference API 部署模型。此外,团队利用 NLI 模型和 Argilla 标注界面优化需求分类与实体识别,确保数据准确入库。
Hugging Face 专家加速项目协助 Witty Works 开发包容性写作助手,解决上下文依赖词汇检测难题。团队采用 Sentence Transformers 架构结合 SetFit 库,仅需 15-20 条标注样本即可完成微调。最终部署 mpnet-base-v2 模型,实现低延迟实时建议。
Salesforce Research 发布的 BLIP-2 模型现已集成至 Hugging Face Transformers,支持图像描述、提示词图像描述、视觉问答及基于聊天的提示。该模型通过轻量级 Q-Former 桥接视觉与语言模型,仅需微调该组件即可利用冻结的预训练视觉编码器和 LLM,显著降低训练成本。
本文介绍利用 ChatGPT 为农场游戏生成故事内容的方法与限制。语言模型易复制现有故事并产生重复,直接商用存在法律与伦理风险。建议将 AI 用于构思大纲或细节补充,最终内容需人工撰写以确保原创性。
本文测试了基于 Intel Sapphire Rapids 架构的服务器在运行 Hugging Face PyTorch Transformers 推理时的性能。
视觉-语言模型通过结合图像和文本编码器,利用对比学习、PrefixLM、交叉注意力融合及 MLM/ITM 等策略进行预训练,以实现零样本泛化。Hugging Face 博客介绍了这些核心训练方法,并展示了如何利用 🤗 Transformers 库进行实验。
Stable Diffusion 的 Image2Image 功能可作为辅助工具融入传统 2D 工作流,通过调整 denoising strength 参数控制模型对输入图像的创意修改程度。
本文梳理 ChatGPT、LaMDA、BlenderBot 等对话智能体的技术细节,指出指令遵循(IFT)与监督微调(SFT)是核心共性。文章详细解析了基于人类标注与模型引导的数据构建方法,并探讨了 RLHF 等对齐技术在确保模型安全与有用性方面的关键作用。
当前文本生成 3D 技术尚未达到实用化标准,无法直接用于游戏开发。尽管 DreamFusion、Point-E 等研究在视图合成方面取得进展,但生成的资产仍需大量后期处理才能就绪。作者建议暂时使用基础几何体代替,并关注 NeRF 转网格或引擎内直接渲染等未来方向。
文章演示了如何利用Hugging Face Datasets和Transformers库构建图像相似度检索系统。通过加载预训练视觉模型提取图像嵌入向量,并使用余弦相似度计算查询图像与候选图像的匹配度。文中提供了完整的Python代码示例,并介绍了使用FAISS进行高效索引和检索的扩展方法。
本文介绍如何使用 ChatGPT 辅助游戏设计,通过提示词获取关于作物多样性、进度系统和社交功能等核心玩法的建议。文章解析了基于 Transformer 架构和 RLHF 技术的语言模型原理,并指出模型虽能加速头脑风暴,但存在幻觉风险,不应作为确定的知识库。
本文介绍图机器学习的基础知识,涵盖图的定义、表示方法及应用场景。图由节点和边组成,可用于药物发现、推荐系统等任务。文中还简要介绍了图神经网络及基于 Transformer 的图学习方法。
Hugging Face 发布系列教程,展示如何利用 AI 工具在 5 天内开发一款功能完整的农场游戏。教程首日演示使用 Stable Diffusion 1.5 生成等距视角的概念艺术,并指导在 Unity 2021.9.3f1 中搭建场景。该指南面向熟悉 C# 的开发者,涵盖从艺术风格设定到引擎集成的完整工作流。
Intel 发布第四代 Xeon CPU Sapphire Rapids,引入 AMX 指令集以加速深度学习矩阵运算。Hugging Face 博客演示了结合 Intel IPEX 和 CCL 库,在 AWS 上利用 r7iz.metal-16xl 裸金属实例集群,无需修改代码即可实现 PyTorch 分布式训练加速。
Hugging Face Datasets 提供一行 Python 代码即可下载和准备音频数据集的功能。通过 Hub 平台可浏览并试听 Common Voice 等数据集,利用 load_dataset 函数可轻松加载 GigaSpeech 等数据。该工具支持流式模式,简化了音频数据的预处理流程。
🤗 Transformers 库内置了 Time Series Transformer 模型,用于单变量时间序列的概率预测。该模型采用 Encoder-Decoder 架构,支持通过祖先采样生成预测分布,并能处理缺失值。文章以澳大利亚旅游数据集为例,演示了如何结合 GluonTS 进行数据预处理与模型训练。
本文解析了文档 AI 的六大用例及对应的开源模型方案。LayoutLMv3 在 PubLayNet 基准测试中 mAP 达 0.951,LayoutLM 在 FUNSD 基准上 F1 分数达 90%。文章涵盖 OCR、文档分类、布局分析及解析等任务,指导利用开源模型构建自定义解决方案。
Hugging Face 在 transformers 库中引入了对比搜索(Contrastive Search)解码方法,该方法在 NeurIPS 2022 上提出,旨在生成人类水平的文本。
Hugging Face发布基于Diffusers训练Stable Diffusion的Dreambooth技巧。推荐低学习率(如1e-6)配合较多训练步数(人脸约1200步)以避免过拟合;微调文本编码器可显著提升质量,但需24GB显存;过拟合时改用DDIM调度器并增加推理步数能改善效果。
推荐理由:原文基于大量实验给出了Dreambooth微调Stable Diffusion的具体超参数建议和避坑指南。
Hugging Face 发布指南,演示如何使用 🤗 Transformers 微调 Whisper 模型进行多语言自动语音识别。文章以 244M 参数的 small 检查点为例,利用 Common Voice 数据集在低资源语言上仅需 8 小时微调数据即可实现高性能。