Hugging Face 收购 XetHub 以升级 Hub 存储与协作能力
Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。
推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。
Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。
推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。
OpenAI 提出将数据与 API 配对以释放客户价值。该策略旨在通过 AI 解锁客户洞察,帮助 Rakuten 等企业实现数据价值转化。
Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。
推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。
OpenAI 在 API 中引入结构化输出功能,使模型输出现在能可靠地遵循开发者提供的 JSON Schema。
推荐理由:API 新增结构化输出功能,使模型输出稳定符合 JSON Schema,降低开发者解析成本。
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Hugging Face 联合 Albumentations AI 发布 TextImage Augmentation 教程,介绍一种同时修改文档图像和文本的多模态数据增强方法。该方法支持随机插入、删除、替换和停用词插入,可生成合成数据并保留修改后的文本标注,适用于视觉语言模型(VLM)在文档图像上的微调。
推荐理由:提供结合文本与图像修改的文档增强方法,帮助解决视觉语言模型在文档数据上的微调难题。
Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope。
推荐理由:Google 发布 Gemma 2 2B 及 ShieldGemma 等新品,提供端侧部署与安全能力更新。
OpenAI 正在测试 SearchGPT,这是全新 AI 搜索功能的一个临时原型。该原型旨在提供快速、及时的回答,并附带清晰且相关的来源。
Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。
推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。
OpenAI 开发并应用了基于规则的奖励(RBRs)新方法,使模型无需大量人工数据收集即可对齐安全行为。该方法通过规则化奖励机制优化模型表现,提升了模型的安全性。
Hugging Face 发布 Llama 3.1 系列模型,包含 405B、70B 和 8B 三种规格,支持多语言与长上下文能力。
推荐理由:Llama 3.1 带来 405B 大参数模型与长上下文支持,为开源多模态生态提供了新的基线选择。
OpenAI 发布 GPT-4o mini 模型,旨在推进成本效益更高的智能。
Mistral 联合 NVIDIA 发布 Mistral NeMo,这是一款 12B 参数的开源模型,支持 128k 上下文窗口,在推理、世界知识和编码方面表现优异。该模型采用 Apache 2.0 协议,支持 FP8 推理且无性能损失,并内置了更高效的 Tekken tokenizer。
推荐理由:12B 模型在同等规模下表现优异,且支持 FP8 推理,为开发者提供了高性价比的开源替代方案。
OpenAI 为 ChatGPT Enterprise 推出合规 API 集成、SCIM 及 GPT 控制功能。这些工具旨在支持大规模用户访问管理、数据安全保障及合规计划。
Prover-Verifier Games 能够提升语言模型输出的可读性,使 AI 解决方案对人和机器而言更清晰、更易验证且更值得信赖。
Mistral AI 发布 Mathstral,这是一个基于 Mistral 7B 微调的数学推理模型,旨在解决需要复杂多步逻辑推理的高级数学问题。该模型在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%,并在其尺寸类别中实现了最先进的推理能力。
推荐理由:基于Mistral 7B微调的数学推理模型,在MATH等基准上表现优异,适合端侧部署与特定领域推理。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。
OpenAI 与洛斯阿拉莫斯国家实验室宣布开展研究合作,旨在开发安全评估方法,以评估和衡量前沿模型相关的生物能力及风险。
Hugging Face 与 KerasHub 实现共享模型保存格式,KerasHub 用户现可直接加载 Hub 上 30 万多个 Transformers 模型。该集成初期支持 Gemma 2、Llama 3 和 PaliGemma 等架构,用户可通过一行代码在 TensorFlow、JAX 或 PyTorch 后端无缝使用这些模型。
Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。
推荐理由:文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。
Hugging Face 在 Dataset Hub 实验性集成开源工具 Presidio,提供自动个人身份信息(PII)检测报告。该功能利用模式匹配和机器学习模型识别数据集中的敏感信息,帮助用户在训练前评估数据隐私风险。数据集所有者也可借此验证过滤流程,构建更合规的模型。
Hugging Face 宣布在 Inference Endpoints 和 Spaces 中支持 Google Cloud TPU v5e。提供 v5litepod-1/4/8 三种实例配置,价格分别为每小时 1.375 美元、5.50 美元和 11.00 美元。配套开源库 Optimum TPU 支持部署 Gemma、Llama 和 Mistral 等模型。
推荐理由:Hugging Face 联合 Google 开放 TPU v5e 部署,提供明确实例配置与价格,便于开发者评估推理成本。
Hugging Face 与 Polyconseil 合作为法国 Banque des Territoires 的 EduRénov 项目部署基于 RAG 的主权数据解决方案,以优化 10,000 所公立学校节能改造的专家支持流程。该方案采用开源模型与 Hugging Face 技术栈,在确保数据主权与计算服务安全的前提下,通过自动化处理大量重复性邮件咨询,提升了对地方当局的响应效率。
Hugging Face 宣布 Dataset Hub 的 Dataset Search 新增按模态、数据量、格式和兼容库筛选功能。用户可通过 Text、Image 等模态、行数范围、Parquet 等格式及 Pandas 等库过滤数据集。这些筛选器可与语言、任务等现有过滤器组合使用,提升数据集发现效率。
Intel 与 MILA 将 ProtST 蛋白质语言模型部署至 Intel Gaudi 2 加速器,实现高效推理与微调。在 ProtST-SubcellularLocalization 数据集上,Gaudi 2 推理速度较 NVIDIA A100 快 1.76 倍,准确率持平。微调任务中,单卡 Gaudi 2 速度提升 2.92 倍,且 4 或 8 卡分布式训练呈现近线性扩展。
Hugging Face 发布独立库 smolagents,其前身 Transformers Agents 基于 Code Agent 在 GAIA 基准测试验证集上取得 44.2% 的成绩排名第一。该方案通过代码执行、安全解释器及多智能体编排,展示了代码动作在复杂任务中的优势。
推荐理由:文章分享了基于代码智能体在GAIA基准测试中取得高分的技术细节,为构建复杂Agent系统提供了可迁移的实践经验。
CriticGPT 是一个基于 GPT-4 的模型,用于撰写 ChatGPT 回复的评论,帮助人类训练师在强化学习人类反馈(RLHF)过程中发现错误。
OpenAI 与 TIME 达成战略合作,利用其 101 年的档案内容优化模型回复质量。该合作旨在增强回答准确性,并向用户直接提供 Time.com 上的故事链接。
Google 发布 Gemma 2 开源大语言模型,包含 9B 和 27B 两种参数规模。该模型在训练数据量、滑动窗口注意力、Logit 软截断及知识蒸馏等方面进行了技术升级,并在多项基准测试中表现优异。Hugging Face 已提供 Transformers 集成、微调工具及推理端点支持。
推荐理由:文章详细拆解了Gemma 2的技术改进与生态集成,为开发者评估和部署提供了具体参考。
XLSCOUT 发布专利专用嵌入模型 ParaEmbed 2.0,在 Hugging Face 专家支持下,通过微调专利数据使准确率较 1.0 版本提升 23%。
高质量数据是AI系统产生优质输出的基础,其核心在于数据必须适配特定用途。数据质量的关键维度包括相关性、全面性、时效性以及偏见缓解。重视数据质量能提升模型性能、鲁棒性、效率及公平性,并支持有效的AI治理与科学可复现性。
Hugging Face 博客发布教程,展示如何在受限资源下微调 Microsoft Florence-2 视觉语言模型。文章通过 DocVQA 数据集实验,验证了冻结视觉编码器并使用小学习率(1e-6)微调的有效性,验证集 Levenshtein 相似度从 0 提升至 57.0,并提供了 Colab 笔记本与完整代码。
推荐理由:提供在受限资源下微调 Florence-2 的完整代码与实验数据,展示如何将其适配至文档问答等下游任务。
OpenAI 宣布收购 Rockset。此次收购旨在增强 OpenAI 在实时数据处理与向量搜索方面的能力,以支持其 AI 应用的底层基础设施需求。
OpenAI 推出网络安全资助计划,旨在通过支持创新研究和人工智能集成来赋能网络安全防御者。该计划重点资助将 AI 技术整合到网络安全领域的创新项目,以提升整体防御能力。
OpenAI 提出一种整体方法,旨在构建用于现实世界内容审核的鲁棒且实用的自然语言分类系统。该方法致力于提升非期望内容检测的准确性与实用性,以应对真实场景中的复杂挑战。
OpenAI 发布改进的一致性模型训练技术。一致性模型是一类新兴的生成模型,无需对抗训练即可在单步采样中生成高质量数据。
Hugging Face 联合 Argilla 发起 Data Is Better Together 倡议,推动开源社区协作构建高质量数据集。社区已完成包含 10K 提示词的 DIBT/10k_prompts_ranked 数据集及多语言评估项目,并发布了 DPO/ORPO 和 KTO 等数据集构建指南。目前该计划仍在持续招募贡献者以完善多语言及特定领域资源。
一致性模型(Consistency Models)旨在解决扩散模型依赖迭代采样导致生成速度慢的问题。扩散模型虽在图像、音频和视频生成领域取得显著进展,但其迭代过程限制了生成效率。
Prezi 加入 Hugging Face 专家支持计划,加速多模态机器学习路线图。其旗舰产品 Prezi AI 结合图像和文本,通过引入开源重排模型优化资产搜索,实现更便宜、快速且准确的演示生成。专家指导帮助非机器学习工程师团队筛选视觉语言模型,并利用 Inference Endpoints 便捷部署,显著提升开发效率。
Paf 在全公司范围采用 ChatGPT Enterprise,工程师日常使用自定义 GPT 加速常规开发任务。该公司还将 ChatGPT Enterprise 集成至 grit:lab 编程学院,以 AI 增强、系统架构思维培养新一代软件开发者。目前 70% 的 Paf 员工(涵盖财务、HR、营销及客服等业务团队)活跃使用该服务。