跳到正文

全部动态

今日 48 条
2月28日周三
  1. Hugging Face Blog73

    BigCode 发布 StarCoder2 模型及 The Stack v2 数据集

    BigCode 发布 StarCoder2 系列开源代码大模型,包含 3B、7B 和 15B 三种参数规模。旗舰版 StarCoder2-15B 基于 4 万亿 tokens 的 The Stack v2 数据集训练,在多项评测中表现匹敌 33B 级别模型。同时开源了 The Stack v2 数据集及全部训练代码。

    推荐理由:StarCoder2 提供 3B 至 15B 三种尺寸,15B 模型在多项评测中匹敌 33B 级别模型,为开发者提供了高效的开源代码生成选择。

2月27日周二
  1. Hugging Face Blog61

    Hugging Face 发布 TTS Arena 语音合成模型排行榜

    Hugging Face 发布 TTS Arena,这是一个基于社区投票的文本转语音(TTS)模型排行榜。该工具允许用户提交文本并对比不同模型的合成效果,通过类似 Elo 的算法对 ElevenLabs、MetaVoice、OpenVoice 等模型进行排名。

    推荐理由:Hugging Face 推出基于社区投票的 TTS 模型排行榜,为开发者提供直观的比较工具。

2月26日周一
  1. Mistral AI85

    Mistral 发布旗舰模型 Mistral Large 及轻量模型 Mistral Small

    Mistral AI 发布最新旗舰语言模型 Mistral Large,该模型原生支持英法西德意五语,具备 32K 上下文窗口、函数调用及 JSON 格式输出能力,在 MMLU 等基准测试中表现优异,并可通过 Azure 获取。同时发布针对低延迟优化的 Mistral Small 模型,两者均支持函数调用与结构化输出功能。

    推荐理由:Mistral 发布旗舰模型并公布多项基准测试成绩,同时推出轻量模型与 API 功能,便于开发者评估选型。

  2. Mistral AI65

    Mistral AI 发布首款对话助手 Le Chat 并开放内测

    Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。

    推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。

  3. Hugging Face Blog37

    AI 水印技术 101:工具与技巧

    本文介绍了针对 AI 生成内容的数字水印技术,涵盖可见与不可见水印、生成时嵌入与生成后处理两种方法,以及 Glaze、Nightshade 等图像防护工具。文章探讨了开放与封闭水印方案的优劣,并展示了 Hugging Face Hub 上用于图像、音频、文本等多模态数据的开源水印工具。

2月23日周五
  1. Hugging Face Blog75

    Matryoshka Embedding 模型原理与 Sentence Transformers 实践指南

    Hugging Face 发布 Matryoshka Embedding 模型教程,介绍其可变维度特性及在 Sentence Transformers 中的训练与使用代码。实验显示截断维度可大幅加速检索并节省存储,且性能损失极小。

    推荐理由:原文详解了Matryoshka Embedding的训练原理与Sentence Transformers代码实现,提供可迁移的降维方法。

  2. Hugging Face Blog38

    Haize Labs 发布红队测试基准 Red Teaming Resistance Benchmark

    Haize Labs 联合 Hugging Face 发布红队测试基准 Red Teaming Resistance Benchmark,旨在评估前沿大语言模型在极端红队攻击下的鲁棒性。该基准通过 AdvBench、AART 等高质量人类攻击数据集,对模型进行压力测试,并依据 OpenAI 使用政策将违规行为细分为暴力、仇恨、欺诈等具体类别。最终得分以模型判定为“安全”的提示词百分比衡量。

2月21日周三
2月20日周二
2月19日周一
  1. Hugging Face Blog75

    🤗 PEFT 新增多种 LoRA 适配器合并方法

    🤗 PEFT 新增多种 LoRA 适配器合并方法,包括 cat、linear、svd、TIES 和 DARE 等算法。开发者可使用 add_weighted_adapter() 在推理时动态合并适配器,实现能力组合与优化。

    推荐理由:提供了多种 LoRA 合并算法与代码示例,帮助开发者在有限资源下组合模型能力。

2月16日周五
  1. Hugging Face Blog87

    Hugging Face 博客:使用合成数据训练专用模型以节省成本

    Hugging Face 发布教程,展示如何利用 Mixtral 等大模型生成合成数据,微调 RoBERTa 等小型专用模型。在金融情感分析案例中,该方案推理成本降至约 2.7 美元(GPT-4 为 3061 美元),碳排放减少至 0.12 千克,且准确率与 GPT-4 持平。

    推荐理由:通过金融情感分析案例,展示了利用开源模型生成合成数据微调专用模型的方法,显著降低推理成本与碳排放。

2月15日周四
  1. OpenAI News93

    Sora:将视频生成模型作为世界模拟器

    OpenAI 发布研究论文,探讨在视频数据上大规模训练生成模型。其最大模型 Sora 采用时空 patch 的 Transformer 架构,能够生成长达一分钟的高保真视频,表明扩展视频生成模型是构建通用物理世界模拟器的有前景路径。

    推荐理由:文章提出将视频生成模型作为世界模拟器,并展示了Sora生成长视频的能力,为物理世界模拟提供了新路径。

2月14日周三
2月13日周二
2月8日周四
  1. Hugging Face Blog70

    Hugging Face 推出 Messages API 实现与 OpenAI 兼容

    Hugging Face 在 TGI 1.4.0 版本中引入 Messages API,提供与 OpenAI Chat Completion API 兼容的接口。该功能支持通过 OpenAI 客户端库、LangChain 和 LlamaIndex 直接调用部署在 Inference Endpoints 上的开源模型,简化了从 OpenAI 到开源 LLM 的迁移流程。

    推荐理由:提供与 OpenAI 兼容的接口,帮助开发者低成本将应用迁移至 Hugging Face 开源模型。

2月3日周六
  1. Hugging Face Blog68

    SegMoE:开源扩散模型混合专家框架与预训练模型

    SegMoE 开源了将多个扩散模型合并为混合专家(MoE)架构的代码与预训练模型,支持 diffusers 并集成于 Hugging Face Hub。该框架通过稀疏 MoE 层替换部分前馈层,发布了 SegMoE-4x2 等版本,旨在结合多个专家模型的优势以提升提示词理解能力。

    推荐理由:开源了将多个扩散模型合并为MoE架构的代码与预训练模型,为社区提供了构建高性能图像生成模型的新工具。

2月2日周五
2月1日周四
  1. Hugging Face Blog80

    Hugging Face 发布开源模型 Constitutional AI 对齐教程与工具

    Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。

    推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。

1月31日周三
1月30日周二
1月29日周一
1月26日周五
  1. Hugging Face Blog40

    AI Secure LLM Safety Leaderboard 发布

    Hugging Face 发布 AI Secure LLM Safety Leaderboard,基于 DecodingTrust 框架评估大语言模型安全性。该榜单涵盖毒性、偏见、对抗鲁棒性、隐私、伦理和公平性等维度,提供红队测试算法与详细报告。研究发现 GPT-4 比 GPT-3.5 更易受攻击,且无单一模型在所有维度均占优。

1月24日周三
1月19日周五
  1. Hugging Face Blog68

    Hugging Face 发布 PatchTSMixer 时间序列模型

    IBM与Hugging Face联合在Transformers库中发布PatchTSMixer,这是一种基于MLP-Mixer架构的轻量级时间序列建模方法。该模型在预测任务中比现有MLP和Transformer模型性能提升8-60%,同时内存和运行时间减少2-3倍。文章提供了在Electricity和ETTh2数据集上进行预测、零样本迁移学习和微调的完整代码示例。

    推荐理由:IBM与Hugging Face联合发布PatchTSMixer,提供轻量级时间序列预测方案及完整教程。

  2. Hugging Face Blog70

    使用Transformers微调W2V2-BERT进行低资源语音识别

    Hugging Face发布教程,演示如何使用Transformers微调Meta的W2V2-BERT模型进行低资源语音识别。文章以蒙古语为例,展示从数据预处理到CTC训练的全流程,该模型在低资源语言上可实现接近Whisper-large-v3的准确率,且推理速度快10-30倍。

    推荐理由:文章提供了基于Transformers微调W2V2-BERT处理低资源语音的完整代码与技巧,可迁移至其他小语种场景。

1月18日周四
  1. Hugging Face Blog67

    Hugging Face 实测对比 DPO、IPO、KTO 三种大模型偏好对齐算法

    Hugging Face 在 alignment-handbook 中实测对比了 DPO、IPO 和 KTO 三种无需强化学习的偏好对齐算法。实验基于 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 模型,使用 MT-Bench 评估发现 DPO 在成对偏好设置中表现最佳,且对超参数 beta 的敏感性因基座模型而异。

    推荐理由:通过MT-Bench实测对比DPO、IPO、KTO三种对齐算法,揭示了超参数敏感性并给出最佳实践参考。

1月16日周二
1月15日周一
1月14日周日
  1. Hugging Face Blog74

    Hugging Face教程:将ComfyUI工作流转为Gradio并部署至ZeroGPU

    Hugging Face发布教程,演示如何将ComfyUI工作流导出为Python脚本,封装为Gradio应用,并部署至Spaces ZeroGPU实现免费推理。以Flux模型为例,详细讲解模型映射、代码重构及模型预加载优化。

    推荐理由:提供将ComfyUI工作流转为Gradio并部署至ZeroGPU的完整代码,实现免费服务器端推理。

1月12日周五
1月10日周三
  1. OpenAI News68

    OpenAI 推出 ChatGPT Team 团队订阅方案

    OpenAI 推出面向各规模团队的 ChatGPT 新订阅方案,提供安全、协作的工作空间,旨在帮助用户在工作中更高效地使用 ChatGPT。

    推荐理由:OpenAI 推出面向团队的 ChatGPT 订阅方案,提供安全协作空间,旨在优化工作场景下的使用体验。

  2. Hugging Face Blog74

    Hugging Face 介绍 Unsloth:实现 LLM 微调速度翻倍

    Hugging Face 博客介绍社区工具 Unsloth,通过重写 PyTorch 模块为 Triton 内核,使 LLM 微调速度提升最高 2.7 倍,显存占用降低最高 74%,且精度无损失。该工具兼容 Hugging Face 生态,支持 Llama 和 Mistral 架构,并可直接与 TRL 库集成使用。

    推荐理由:文章提供了基于Triton内核优化的具体代码示例,帮助读者在保持精度的同时显著降低显存占用并提升微调速度。

1月8日周一