跳到正文

全部动态

今日 48 条
8月8日周四
  1. Hugging Face Blog68

    Hugging Face 收购 XetHub 以升级 Hub 存储与协作能力

    Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。

    推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。

8月7日周三
  1. Mistral AI63

    Mistral 开放模型微调与 Agent 功能并推出 SDK 1.0

    Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。

    推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。

8月6日周二
  1. Hugging Face Blog32

    Hugging Face 2024 安全功能亮点

    Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。

  2. Hugging Face Blog68

    Hugging Face 联合 Albumentations 发布文档图像多模态增强教程

    Hugging Face 联合 Albumentations AI 发布 TextImage Augmentation 教程,介绍一种同时修改文档图像和文本的多模态数据增强方法。该方法支持随机插入、删除、替换和停用词插入,可生成合成数据并保留修改后的文本标注,适用于视觉语言模型(VLM)在文档图像上的微调。

    推荐理由:提供结合文本与图像修改的文档增强方法,帮助解决视觉语言模型在文档数据上的微调难题。

7月31日周三
7月25日周四
7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

7月23日周二
7月18日周四
  1. Mistral AI82

    Mistral 联合 NVIDIA 发布 12B 开源模型 Mistral NeMo

    Mistral 联合 NVIDIA 发布 Mistral NeMo,这是一款 12B 参数的开源模型,支持 128k 上下文窗口,在推理、世界知识和编码方面表现优异。该模型采用 Apache 2.0 协议,支持 FP8 推理且无性能损失,并内置了更高效的 Tekken tokenizer。

    推荐理由:12B 模型在同等规模下表现优异,且支持 FP8 推理,为开发者提供了高性价比的开源替代方案。

7月17日周三
7月16日周二
  1. Mistral AI65

    Mistral 发布 Mathstral 数学推理模型

    Mistral AI 发布 Mathstral,这是一个基于 Mistral 7B 微调的数学推理模型,旨在解决需要复杂多步逻辑推理的高级数学问题。该模型在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%,并在其尺寸类别中实现了最先进的推理能力。

    推荐理由:基于Mistral 7B微调的数学推理模型,在MATH等基准上表现优异,适合端侧部署与特定领域推理。

  2. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。

    推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。

7月10日周三
  1. Hugging Face Blog72

    使用TRL库通过DPO微调多模态模型

    Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。

    推荐理由:文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。

7月9日周二
  1. Hugging Face Blog65

    Hugging Face 开放 Google Cloud TPU v5e 部署支持

    Hugging Face 宣布在 Inference Endpoints 和 Spaces 中支持 Google Cloud TPU v5e。提供 v5litepod-1/4/8 三种实例配置,价格分别为每小时 1.375 美元、5.50 美元和 11.00 美元。配套开源库 Optimum TPU 支持部署 Gemma、Llama 和 Mistral 等模型。

    推荐理由:Hugging Face 联合 Google 开放 TPU v5e 部署,提供明确实例配置与价格,便于开发者评估推理成本。

  2. Hugging Face Blog23

    Hugging Face 与 Polyconseil 合作为法国 EduRénov 项目打造主权数据 RAG 解决方案

    Hugging Face 与 Polyconseil 合作为法国 Banque des Territoires 的 EduRénov 项目部署基于 RAG 的主权数据解决方案,以优化 10,000 所公立学校节能改造的专家支持流程。该方案采用开源模型与 Hugging Face 技术栈,在确保数据主权与计算服务安全的前提下,通过自动化处理大量重复性邮件咨询,提升了对地方当局的响应效率。

7月8日周一
7月3日周三
7月1日周一
  1. Hugging Face Blog74

    Hugging Face 发布 smolagents 并在 GAIA 基准测试中登顶

    Hugging Face 发布独立库 smolagents,其前身 Transformers Agents 基于 Code Agent 在 GAIA 基准测试验证集上取得 44.2% 的成绩排名第一。该方案通过代码执行、安全解释器及多智能体编排,展示了代码动作在复杂任务中的优势。

    推荐理由:文章分享了基于代码智能体在GAIA基准测试中取得高分的技术细节,为构建复杂Agent系统提供了可迁移的实践经验。

6月27日周四
  1. Hugging Face Blog86

    Gemma 2 发布:Google 开源新一代大语言模型

    Google 发布 Gemma 2 开源大语言模型,包含 9B 和 27B 两种参数规模。该模型在训练数据量、滑动窗口注意力、Logit 软截断及知识蒸馏等方面进行了技术升级,并在多项基准测试中表现优异。Hugging Face 已提供 Transformers 集成、微调工具及推理端点支持。

    推荐理由:文章详细拆解了Gemma 2的技术改进与生态集成,为开发者评估和部署提供了具体参考。

6月25日周二
6月24日周一
  1. Hugging Face Blog68

    Hugging Face 博客:微调 Microsoft Florence-2 视觉语言模型

    Hugging Face 博客发布教程,展示如何在受限资源下微调 Microsoft Florence-2 视觉语言模型。文章通过 DocVQA 数据集实验,验证了冻结视觉编码器并使用小学习率(1e-6)微调的有效性,验证集 Levenshtein 相似度从 0 提升至 57.0,并提供了 Colab 笔记本与完整代码。

    推荐理由:提供在受限资源下微调 Florence-2 的完整代码与实验数据,展示如何将其适配至文档问答等下游任务。

6月21日周五
  1. OpenAI News40

    OpenAI 收购 Rockset

    OpenAI 宣布收购 Rockset。此次收购旨在增强 OpenAI 在实时数据处理与向量搜索方面的能力,以支持其 AI 应用的底层基础设施需求。

6月20日周四
  1. Hugging Face Blog28

    Hugging Face 与 Argilla 回顾 Data Is Better Together 开源数据集协作计划

    Hugging Face 联合 Argilla 发起 Data Is Better Together 倡议,推动开源社区协作构建高质量数据集。社区已完成包含 10K 提示词的 DIBT/10k_prompts_ranked 数据集及多语言评估项目,并发布了 DPO/ORPO 和 KTO 等数据集构建指南。目前该计划仍在持续招募贡献者以完善多语言及特定领域资源。

  2. OpenAI News15

    一致性模型

    一致性模型(Consistency Models)旨在解决扩散模型依赖迭代采样导致生成速度慢的问题。扩散模型虽在图像、音频和视频生成领域取得显著进展,但其迭代过程限制了生成效率。

6月19日周三
  1. Hugging Face Blog15

    Prezi 如何利用 Hugging Face Hub 和专家支持计划加速多模态机器学习路线图

    Prezi 加入 Hugging Face 专家支持计划,加速多模态机器学习路线图。其旗舰产品 Prezi AI 结合图像和文本,通过引入开源重排模型优化资产搜索,实现更便宜、快速且准确的演示生成。专家指导帮助非机器学习工程师团队筛选视觉语言模型,并利用 Inference Endpoints 便捷部署,显著提升开发效率。

6月18日周二
  1. OpenAI News17

    使用自定义 GPT 提升开发者生产力

    Paf 在全公司范围采用 ChatGPT Enterprise,工程师日常使用自定义 GPT 加速常规开发任务。该公司还将 ChatGPT Enterprise 集成至 grit:lab 编程学院,以 AI 增强、系统架构思维培养新一代软件开发者。目前 70% 的 Paf 员工(涵盖财务、HR、营销及客服等业务团队)活跃使用该服务。