跳到正文

全部动态

今日 42 条
8月12日周一
  1. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

8月8日周四
  1. Hugging Face Blog68

    Hugging Face 收购 XetHub 以升级 Hub 存储与协作能力

    Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。

    推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。

8月7日周三
  1. Mistral AI63

    Mistral 开放模型微调与 Agent 功能并推出 SDK 1.0

    Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。

    推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。

8月6日周二
  1. Hugging Face Blog32

    Hugging Face 2024 安全功能亮点

    Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。

  2. Hugging Face Blog68

    Hugging Face 联合 Albumentations 发布文档图像多模态增强教程

    Hugging Face 联合 Albumentations AI 发布 TextImage Augmentation 教程,介绍一种同时修改文档图像和文本的多模态数据增强方法。该方法支持随机插入、删除、替换和停用词插入,可生成合成数据并保留修改后的文本标注,适用于视觉语言模型(VLM)在文档图像上的微调。

    推荐理由:提供结合文本与图像修改的文档增强方法,帮助解决视觉语言模型在文档数据上的微调难题。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

7月16日周二
  1. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。

    推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。

6月5日周三
  1. Mistral AI68

    Mistral 推出模型微调服务与开源 SDK

    Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。

    推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。

5月29日周三
  1. Mistral AI83

    Mistral 发布首个代码模型 Codestral

    Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。

    推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

2月26日周一
  1. Mistral AI65

    Mistral AI 发布首款对话助手 Le Chat 并开放内测

    Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。

    推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

9月27日周三
  1. Mistral AI90

    Mistral AI 发布 Mistral 7B 开源模型

    Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。

    推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。

6月12日周一
  1. Hugging Face Blog20

    Hugging Face Hub 面向 GLAM 领域的应用指南

    Hugging Face Hub 面向画廊、图书馆、档案馆和博物馆(GLAM)领域发布应用指南,介绍如何利用该平台共享和访问机器学习模型、数据集及演示应用。平台目前托管超过 19 万个模型、3.3 万个数据集和 10 万个应用,支持通过 API 部署或集成 Transformers 库使用。文章详细演示了如何筛选特定任务与语言的模型,以及如何上传 CSV 格式的数据集。

6月7日周三
6月6日周二
6月5日周一
  1. Hugging Face Blog86

    Hugging Face 发布 Falcon 开源大语言模型

    阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。

    推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。

6月2日周五
  1. Hugging Face Blog28

    Hugging Face Unity API 实现语音识别教程

    Hugging Face 发布 Unity API 语音识别教程,指导开发者在 Unity 游戏中实现语音转文本功能。教程详细演示了如何设置 UI 组件、编写 C# 脚本调用麦克风录制音频,并将 WAV 格式数据通过 API 处理。该功能可用于 NPC 交互、游戏指令控制及无障碍辅助。

6月1日周四
5月31日周三
5月25日周四
5月24日周三
5月23日周二
  1. Hugging Face Blog65

    Safetensors 通过安全审计并将在 Transformers 中成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。

    推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。

  2. Hugging Face Blog43

    Hugging Face 与 IBM 合作 watsonx.ai,面向 AI 开发者的下一代企业级工作室

    Hugging Face 与 IBM 宣布合作,将 Hugging Face 开源库集成至 IBM watsonx.ai 平台。watsonx.ai 是基于 RedHat OpenShift 构建的下一代企业 AI 工作室,支持在云端和本地部署,旨在帮助客户训练、验证、微调及部署传统机器学习与生成式 AI 模型。双方还将合作将 IBM 开发的大语言模型开源至 Hugging Face Hub。

5月16日周二
5月11日周四
  1. Hugging Face Blog78

    Hugging Face 推出辅助生成技术降低文本生成延迟

    Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)技术,利用小模型生成候选 token 并由大模型验证,从而减少前向传播次数。该方法在模型显存不足需卸载时最高可实现 10 倍加速,在显存充足时也可获得 2 至 3 倍加速,且支持贪婪解码与采样。

    推荐理由:Hugging Face 在 Transformers 中引入辅助生成技术,通过小模型辅助大模型解码,显著降低文本生成延迟。

5月9日周二
  1. Hugging Face Blog73

    Hugging Face 发布 StarChat Alpha 编程助手

    Hugging Face 发布基于 StarCoder 微调的编程助手 StarChat Alpha,采用 ChatML 格式与 OpenAssistant 数据集训练,提供代码、数据集及模型下载。

    推荐理由:文章展示了基于StarCoder微调出StarChat Alpha的过程,提供了ChatML格式和DeepSpeed训练代码供开发者复用。

5月8日周一
  1. Hugging Face Blog38

    深入解析文本生成视频模型

    文本生成视频模型正成为生成式AI的重要进展,旨在从文本描述中生成时空一致的视频序列。该任务面临计算成本高、高质量数据集稀缺及视频描述模糊等独特挑战。Hugging Face 博客回顾了从 GAN 到 Transformer 再到扩散模型的演进,并分享了相关演示与资源。

5月4日周四
  1. Hugging Face Blog82

    StarCoder 发布:面向代码的大语言模型

    Hugging Face 发布 StarCoder 和 StarCoderBase 代码大语言模型,在 HumanEval 等基准上达到开源 SOTA。模型基于 The Stack 数据集训练,提供完整训练数据、PII 移除工具及 BigCode OpenRAIL-M 许可证。

    推荐理由:模型在HumanEval等基准上达到开源SOTA,提供完整训练数据与治理工具,适合二次开发。

5月1日周一
  1. Hugging Face Blog36

    如何在 Unity 项目中安装和使用 Hugging Face Unity API

    Hugging Face Unity API 允许开发者在 Unity 项目中通过 Git URL 安装并调用 Hugging Face Inference API。该 API 支持对话、文本生成、图像生成、分类、问答、翻译、摘要及语音识别等任务,并提供自定义模型端点配置。开发者可通过 API Wizard 输入密钥测试连接,并在脚本中异步调用相应方法处理回调结果。

4月27日周四
4月26日周三
4月24日周一
  1. Hugging Face Blog8

    Hugging Face 推出面向中文用户的官方博客

    Hugging Face 推出面向中文用户的官方博客 hf.co/blog/zh,由志愿者翻译博客文章及 Transformer、扩散模型和强化学习课程。此举旨在服务日益增长的中文 AI 社区,促进相互学习与协作。Hugging Face 将加强与 PaddlePaddle 等组织的合作,并继续举办线上课程及线下活动以推动开源机器学习领域的知识共享。

4月6日周四
4月5日周三
  1. Hugging Face Blog65

    StackLLaMA:手把手教你用RLHF微调LLaMA模型

    Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

    推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

3月30日周四
  1. Hugging Face Blog22

    Hugging Face 发布伦理与社会通讯第 3 期:探讨开放 AI 的伦理责任

    Hugging Face 发布伦理与社会通讯第 3 期,阐述在开源机器学习中平衡开放性与风险控制的伦理框架。平台推出涵盖严谨、同意、社会意识等 6 个维度的伦理标签,并上线内容举报功能以识别违规模型与数据集。此外,Hugging Face 通过完善模型卡片、推广 RAIL 许可证及社区协作机制,致力于最小化 AI 潜在危害。

3月28日周二