Hugging Face 与 Protect AI 合作增强模型安全
Hugging Face 宣布与 Protect AI 合作,将 Guardian 安全扫描工具集成至 Hub 扫描套件。所有公开模型仓库在上传文件时将自动接受 Guardian 扫描,以检测 pickle 等序列化格式中的任意代码执行漏洞。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 安全扫描工具集成至 Hub 扫描套件。所有公开模型仓库在上传文件时将自动接受 Guardian 扫描,以检测 pickle 等序列化格式中的任意代码执行漏洞。
Hugging Face Diffusers 正式支持 Stable Diffusion 3.5 Large,提供 8B 参数模型及少步推理的 Turbo 版本。文章介绍了 QK 归一化与双注意力层等架构变化,并给出了量化推理与 LoRA 微调的实操代码。
推荐理由:文章详细说明了SD3.5 Large的架构变化及Diffusers使用方式,并提供了量化推理与微调的实操指南。
Keras 已原生支持加载 Llama 3.2 模型,用户可直接使用 safetensors 格式权重进行生成、训练和微调。文章演示了通过 keras-hub 调用模型,利用 JAX 后端实现多 GPU/TPU 并行推理,并展示了在 TPU 上微调 Llama 3.1 8B 模型的完整流程。
Hugging Face 修复了 Transformers Trainer 在梯度累积时损失计算不匹配的问题,确保数学等价于全批量训练。同时暴露 API 允许用户传入自定义损失函数,并将在后续版本中全面支持。
推荐理由:修复了梯度累积下损失计算偏差,并开放自定义损失函数API,帮助开发者规避训练误差。
Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。
Hugging Face 验证 AMD 5th Gen EPYC Turin CPU 在 LLM 推理中实现 2 倍加速。通过 ZenDNN PyTorch 插件 zentorch 优化 torch.compile,AMD Turin 在 Meta LLaMA 3.1 8B 的摘要、聊天等五种场景下,吞吐量较 AMD Genoa 提升约 2 倍。
Hugging Face博客介绍利用Dask和Coiled将数据处理规模从100行扩展至2.11亿行的方法。通过FineWeb-Edu分类器在云端多GPU上并行运行文本分类,实现了TB级数据集的高效清洗与结构化。
Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。
推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。
Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。
推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。
Hugging Face 发布 Open FinLLM Leaderboard,填补金融领域大语言模型评估空白。该榜单涵盖信息提取、情感分析、信用风险评分等七大类别,采用零样本评估方法,通过准确率、F1 分数等指标衡量模型在真实金融场景中的表现。
2024年中国AI企业加速海外扩张,华为、腾讯、阿里等巨头聚焦中东、东南亚及非洲的云计算与AI基础设施,字节跳动则深耕西方B2C市场。面对国内238个大语言模型引发的激烈价格战与盈利压力,MiniMax、01.AI等初创公司转向海外C端应用探索,Talkie和PopAI等产品已实现盈利。
BenCzechMark 是首个全面评估大语言模型捷克语能力的评测基准,涵盖 50 项任务和 9 个类别。该基准包含 90% 的原生非翻译内容,提供准确率、精确匹配、AUROC 和困惑度等指标。目前排行榜已收录 25 多个不同规模的开源模型。
Hugging Face 推出 Daily Papers 页面,已收录超 3,700 篇论文并拥有超 12k 订阅者。作者可一键认领论文以关联账号,用户可通过评论 @username 与作者实时互动,并在评论区输入 @librarian-bot 获取相关论文推荐。页面支持多语言评论及内置翻译,并集成 arXiv 扩展功能以快速跳转至 Hugging Face 论文页或 Spaces 演示。
Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。
推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。
Hugging Face 发布教程,介绍如何利用 Optimum-Intel 和 OpenVINO GenAI 将 Transformers 模型部署到边缘设备。内容涵盖环境配置、模型导出为 OpenVINO IR、基于 NNCF 的 INT4 量化优化,以及通过 LLMPipeline 在 Python 和 C++ 中进行推理部署的具体代码示例。
Hugging Face 发布基于 BitNet 架构的 LLaMA3 8B 1.58bit 模型,公开了通过动态 Lambda 调度实现微调的技术细节与 Triton 自定义内核,模型在 MMLU 等基准上表现优异。
推荐理由:文章公开了将LLaMA3微调至1.58bit的量化方法与代码,为降低大模型推理成本提供了可复用的工程方案。
Mistral AI 发布 Mistral Small v24.09 模型,下调全线模型 API 价格,并推出 la Plateforme 免费层。le Chat 免费开放 Pixtral 12B 视觉能力,支持任意尺寸图片理解。
推荐理由:官方同步更新模型定价与发布新模型,提供了免费层与Apache 2.0授权,便于评估成本与部署方案。
Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。
推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。
Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。
推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。
HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。
推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。
Hugging Face 发布 Accelerate 1.0.0 首个候选版,新增 FP8 训练、torch.compile 及多模型 DeepSpeed 支持。该版本稳定了核心 API,并提供了详细的弃用项与迁移指南。
Hugging Face 与 TruffleHog 达成合作,将 TruffleHog 的密钥扫描功能集成至平台。Hugging Face 在自动化扫描管道中引入 TruffleHog 检测密码、Token 和 API 密钥,并在发现已验证密钥时通过邮件通知用户。
Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。
推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。
Meta Llama 3.1 405B 模型可在 Google Cloud Vertex AI 上部署,推荐使用 FP8 量化版本以适配 8 x H100 的 A3 节点。该模型具备 128K tokens 上下文窗口,支持多语言及工具使用。部署需配置 Vertex AI API 并申请 A3 节点配额。
Hugging Face 复现 Infini-Attention 失败,发现随着内存压缩次数增加,模型性能反而下降。在将 Llama 3 8B 扩展至 100 万 token 上下文的实验中,Ring Attention、YaRN 和 rope scaling 仍是目前延长预训练模型上下文长度的最佳方案。
ggml 是一个专注于 Transformer 推理的 C/C++ 开源机器学习库,具有极简、轻量且兼容性好的特点。该库核心代码少于 5 个文件,编译后二进制体积小于 1MB,支持量化张量以节省内存。本文面向开发者介绍 ggml 的基础概念、编译方法及核心 API 使用,涵盖上下文、计算图及后端接口等关键术语。
Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。
推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。
TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。
推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。
Hugging Face 宣布收购 XetHub,其团队将负责将 Hub 的存储后端从 Git LFS 替换为更优化的版本。XetHub 技术支持 TB 级仓库的 Git 扩展、分块存储与去重,使用户在更新大型数据集或模型时仅需上传变更部分,从而大幅提升协作与版本管理效率。
推荐理由:Hugging Face 收购 XetHub 以替换 Git LFS 存储后端,将显著提升 TB 级数据集和模型的版本管理与协作效率。
Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。
推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Hugging Face 联合 Albumentations AI 发布 TextImage Augmentation 教程,介绍一种同时修改文档图像和文本的多模态数据增强方法。该方法支持随机插入、删除、替换和停用词插入,可生成合成数据并保留修改后的文本标注,适用于视觉语言模型(VLM)在文档图像上的微调。
推荐理由:提供结合文本与图像修改的文档增强方法,帮助解决视觉语言模型在文档数据上的微调难题。
Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。
推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。
推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。
推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。
Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。
推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。