跳到正文

全部动态

今日 48 条
1月4日周四
  1. Hugging Face Blog66

    Hugging Face 开源非扩散图像生成模型 aMUSEd

    Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。

    推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。

1月2日周二
12月20日周三
  1. Hugging Face Blog75

    使用推测解码将 Whisper 推理速度提升 2 倍

    Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。

    推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。

12月18日周一
  1. Hugging Face Blog73

    Hugging Face 2023 开源大模型年度回顾

    Hugging Face 发布 2023 年开源大模型年度回顾,指出行业从规模竞赛转向数据竞赛,LLaMA、Mistral 等中小模型爆发。文章详细梳理了 RLHF、DPO 等对话微调技术的普及,以及模型合并、PEFT 和量化等技术如何推动开源生态发展。

    推荐理由:梳理了2023年开源大模型从规模竞赛转向数据竞赛的演进脉络及社区微调生态。

12月14日周四
12月13日周三
12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

  2. Hugging Face Blog86

    Hugging Face 发布 Mixtral 8x7B 模型集成与部署指南

    Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。

    推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。

12月6日周三
  1. Hugging Face Blog68

    Hugging Face 发布 SetFitABSA 少样本方面级情感分析框架

    Hugging Face 与 Intel Labs 联合发布 SetFitABSA,这是一种基于 SetFit 框架的少样本方面级情感分析(ABSA)技术。该方法无需设计 Prompt,通过提取方面候选词并分类,在 Laptop14 和 Restaurant14 数据集上以 2.2 亿参数规模在少样本场景下表现优于 Llama-2 和 T5。

    推荐理由:SetFitABSA 提供了无需 Prompt 且训练极快的少样本情感分析方案,适合资源受限场景。

12月5日周二
  1. Hugging Face Blog68

    Hugging Face 发布 Optimum-NVIDIA 库,一行代码解锁极速 LLM 推理

    Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。

    推荐理由:通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。

12月1日周五
11月29日周三
11月9日周四
11月7日周二
11月6日周一
  1. OpenAI News78

    OpenAI 发布自定义 GPT 功能

    OpenAI 宣布推出自定义 GPT 功能,允许用户创建结合指令、额外知识和技能组合的 ChatGPT 定制版本。

    推荐理由:原文宣布开放自定义GPT功能,允许用户组合指令、知识与技能,为构建专属智能体提供直接入口。

10月26日周四
10月25日周三
  1. Hugging Face Blog33

    一行代码使用 Renumics Spotlight 交互式探索 Hugging Face 数据集

    Renumics Spotlight 提供一行代码即可交互式可视化 Hugging Face datasets 数据,支持通过模型预测和嵌入向量深入分析数据分布与模型失败模式。该工具直接基于 datasets 库构建,无需复制数据即可高效加载表格与非结构化数据,并允许通过 Python API 自定义检查工作流以辅助模型调试。

10月24日周二
  1. Hugging Face Blog75

    Hugging Face 复现 OpenAI 原始 RLHF 代码的 N 个实现细节

    Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。

    推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。

10月19日周四
  1. Hugging Face Blog70

    Gradio-Lite 发布:无需服务器的浏览器端 Gradio 运行方案

    Hugging Face 发布 Gradio-Lite,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。该方案支持多文件和额外依赖安装,具备低延迟和隐私安全优势,但首次加载需 5-15 秒且依赖包兼容性受限。

    推荐理由:Gradio-Lite 将应用运行移至浏览器端,免去了服务器部署成本,适合快速分享和隐私保护场景。

10月11日周三
10月4日周三
10月3日周二
  1. Hugging Face Blog37

    Hugging Face Diffusers 支持在 Cloud TPU v5e 上通过 JAX 加速 Stable Diffusion XL 推理

    Hugging Face Diffusers 新增对 JAX 的支持,可在 Google Cloud TPU v5e 上高效运行 Stable Diffusion XL。该方案利用 JIT 编译和 pmap 并行化,在 TPU v5e-4 实例上生成 1024×1024 图像的实际耗时约 2.3 秒。TPU v5e 成本低于 TPU v4 的一半,显著提升了大规模 AI 推理的性能与性价比。

  2. Hugging Face Blog73

    Hugging Face 引入 chat_template 属性以统一对话格式

    Hugging Face 在 Tokenizer 中引入 chat_template 属性,使用 Jinja 模板保存模型训练时的对话格式,防止因格式不匹配导致性能下降。用户可通过 apply_chat_template() 方法格式化输入,或提交 PR 为缺少模板的模型补充模板。

    推荐理由:Hugging Face 在 Tokenizer 中引入 chat_template 属性,通过保存训练时的对话格式来避免推理时的性能下降。

最多提供 50 页,更早的内容请使用搜索或主题页。