跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 201–220 条 · 共 251 条
10月22日周二
  1. Hugging Face Blog83

    Diffusers 支持 Stable Diffusion 3.5 Large 发布

    Hugging Face Diffusers 正式支持 Stable Diffusion 3.5 Large,提供 8B 参数模型及少步推理的 Turbo 版本。文章介绍了 QK 归一化与双注意力层等架构变化,并给出了量化推理与 LoRA 微调的实操代码。

    推荐理由:文章详细说明了SD3.5 Large的架构变化及Diffusers使用方式,并提供了量化推理与微调的实操指南。

10月16日周三
  1. Hugging Face Blog66

    Hugging Face Transformers 修复梯度累积损失计算问题

    Hugging Face 修复了 Transformers Trainer 在梯度累积时损失计算不匹配的问题,确保数学等价于全批量训练。同时暴露 API 允许用户传入自定义损失函数,并将在后续版本中全面支持。

    推荐理由:修复了梯度累积下损失计算偏差,并开放自定义损失函数API,帮助开发者规避训练误差。

10月9日周三
  1. Hugging Face Blog70

    Gradio 5 稳定版发布

    Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。

    推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。

10月8日周二
  1. Hugging Face Blog75

    Hugging Face Transformers 4.45.0 默认启用动态推测解码

    Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。

    推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。

9月23日周一
  1. Hugging Face Blog68

    Hugging Face 发布 FineVideo 数据集及构建管线

    Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。

    推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。

9月18日周三
9月17日周二
  1. Hugging Face Blog70

    Hugging Face 推出数据集 SQL Console 功能

    Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。

    推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。

9月16日周一
  1. Hugging Face Blog65

    HuggingChat 发布社区工具功能

    HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。

    推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。

8月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 DataCollatorWithFlattening 实现 Flash Attention 2 无填充训练

    Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。

    推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。

8月12日周一
  1. Hugging Face Blog73

    Hugging Face 推出统一工具调用 API 与工程实践

    Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。

    推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。

  2. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

8月8日周四
  1. Hugging Face Blog68

    Hugging Face 收购 XetHub 以升级 Hub 存储与协作能力

    Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。

    推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。

8月6日周二
  1. Hugging Face Blog68

    Hugging Face 联合 Albumentations 发布文档图像多模态增强教程

    Hugging Face 联合 Albumentations AI 发布 TextImage Augmentation 教程,介绍一种同时修改文档图像和文本的多模态数据增强方法。该方法支持随机插入、删除、替换和停用词插入,可生成合成数据并保留修改后的文本标注,适用于视觉语言模型(VLM)在文档图像上的微调。

    推荐理由:提供结合文本与图像修改的文档增强方法,帮助解决视觉语言模型在文档数据上的微调难题。

1月19日周五
  1. Hugging Face Blog68

    Hugging Face 发布 PatchTSMixer 时间序列模型

    IBM与Hugging Face联合在Transformers库中发布PatchTSMixer,这是一种基于MLP-Mixer架构的轻量级时间序列建模方法。该模型在预测任务中比现有MLP和Transformer模型性能提升8-60%,同时内存和运行时间减少2-3倍。文章提供了在Electricity和ETTh2数据集上进行预测、零样本迁移学习和微调的完整代码示例。

    推荐理由:IBM与Hugging Face联合发布PatchTSMixer,提供轻量级时间序列预测方案及完整教程。

1月10日周三
  1. Hugging Face Blog74

    Hugging Face 介绍 Unsloth:实现 LLM 微调速度翻倍

    Hugging Face 博客介绍社区工具 Unsloth,通过重写 PyTorch 模块为 Triton 内核,使 LLM 微调速度提升最高 2.7 倍,显存占用降低最高 74%,且精度无损失。该工具兼容 Hugging Face 生态,支持 Llama 和 Mistral 架构,并可直接与 TRL 库集成使用。

    推荐理由:文章提供了基于Triton内核优化的具体代码示例,帮助读者在保持精度的同时显著降低显存占用并提升微调速度。

1月4日周四
  1. Hugging Face Blog66

    Hugging Face 开源非扩散图像生成模型 aMUSEd

    Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。

    推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。

12月20日周三
  1. Hugging Face Blog75

    使用推测解码将 Whisper 推理速度提升 2 倍

    Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。

    推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。

12月11日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Mixtral 8x7B 模型集成与部署指南

    Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。

    推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。