Hugging Face 发布 LeRobotDataset v3.0 支持流式读取与大规模存储
Hugging Face 发布 LeRobotDataset v3.0,将多个片段合并存储以解决文件系统限制,并原生支持流式读取。该格式通过 Parquet 和 MP4 优化存储,提供一键转换脚本,将集成至 lerobot 库 v0.4.0 版本。
推荐理由:通过多片段合并与流式读取解决大规模机器人数据集存储瓶颈,提供一键转换工具。
Hugging Face 发布 LeRobotDataset v3.0,将多个片段合并存储以解决文件系统限制,并原生支持流式读取。该格式通过 Parquet 和 MP4 优化存储,提供一键转换脚本,将集成至 lerobot 库 v0.4.0 版本。
推荐理由:通过多片段合并与流式读取解决大规模机器人数据集存储瓶颈,提供一键转换工具。
Hugging Face 升级 transformers 库以支持 OpenAI GPT-OSS 系列模型,新增 MXFP4 量化、张量并行、专家并行及动态滑动窗口缓存等部署优化。通过 Hub 下载预编译内核,显著降低显存占用并提升推理效率。
推荐理由:Hugging Face 为 GPT-OSS 提供开箱即用的部署支持,涵盖 MXFP4 量化与多卡并行,为社区提供了可复用的工程参考。
Together AI 宣布与 Hugging Face 集成,允许开发者通过 API 直接微调 Hugging Face Hub 上的兼容模型。用户只需指定基础模型配置和 HF 模型,即可利用 Together 基础设施完成训练,并可将结果推回 Hub。
推荐理由:Together AI 打通 Hugging Face Hub 实现一键微调,降低开发门槛并加速模型迭代。
Hugging Face 发布 Jupyter Agent,开源了基于 Qwen3-4B 微调的模型及训练数据集,旨在让小型模型具备在 Jupyter Notebook 中执行代码解决数据分析任务的能力。该模型在 DABStep 基准测试的简单任务上准确率提升至 75%,并提供了完整的 Kaggle 数据集清洗、QA 生成及微调代码。
推荐理由:Hugging Face 开源了基于 Qwen3-4B 微调的 Jupyter Agent 模型及数据集,展示了通过高质量数据与精简脚手架提升小模型数据分析能力的有效路径。
Hugging Face 发布 mmBERT,基于 ModernBERT 架构训练的多语言编码器模型,覆盖 1800 多种语言,在 XTREME 和 MTEB 基准上显著超越 XLM-R 等前代模型。该模型采用三阶段渐进式语言学习策略,在 3T+ tokens 数据上训练,推理速度提升 2-4 倍,并开源了模型权重、训练数据及微调代码。
推荐理由:开源了覆盖1800种语言的现代BERT架构模型,提供了显著的性能与速度提升及微调代码。
Google发布EmbeddingGemma,一款仅308M参数、支持100多种语言的开源多语言嵌入模型,专为端侧设备设计。该模型基于Gemma3架构,在MTEB基准测试中表现优异,并提供了Sentence Transformers、LangChain、LlamaIndex等主流框架的集成示例及微调指南。
推荐理由:模型仅308M参数且支持100+语言,适合端侧部署,并提供了多框架集成与微调指南。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含 524 万条由 Boltz1 生成的 AI 共折叠蛋白-配体 3D 结构及实验验证的 IC50 数据。该数据集采用 CC BY 4.0 许可,97% 的结构通过了 PoseBusters 验证,旨在解决 AI 药物研发中高质量结构数据的长期短缺问题。
推荐理由:SAIR 开源了 524 万条高精度蛋白-配体 3D 结构及 IC50 数据,为 AI 药物发现提供了稀缺的高质量训练集。
Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。
推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。
通过 MCP 将 Claude 接入 Hugging Face Spaces,可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。FLUX.1 Krea [dev] 擅长消除 AI 痕迹,生成具有自然光照和真实质感的图片。Qwen-Image 则具备强大的提示词遵循能力和准确的文本渲染效果,适合制作海报等含文字的设计。
Hugging Face 发布 Research Tracker MCP 工具,允许 AI 智能体通过自然语言自动化跨 arXiv、GitHub 和 Hugging Face 的文献发现流程。该工具将手动搜索和脚本工具封装为 MCP 标准接口,支持 Claude Desktop、Cursor 等客户端直接调用,简化了论文、代码和模型的交叉检索。
Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。
推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。
Hugging Face开源了Kimina-Prover-RL,一个基于Verl框架的Lean 4形式化定理证明训练管线,并发布了1.7B和0.6B两个模型。该管线采用类DeepSeek-R1的结构化推理范式,结合格式奖励和错误纠正机制,在MiniF2F基准上刷新了开源模型在对应参数规模下的SOTA成绩。
推荐理由:开源了基于Verl的Lean 4定理证明训练管线及0.6B和1.7B模型,为小参数模型形式化推理提供了可复现的SOTA方案。
ExecuTorch 0.7 beta 发布,默认启用 KleidiAI 加速,利用 Arm SDOT 指令集为旧款手机和树莓派等设备提供开箱即用的端侧推理性能。
推荐理由:ExecuTorch 0.7 默认启用 KleidiAI 并支持旧款设备,为端侧推理提供了开箱即用的性能优化方案。
Hugging Face 发布 FilBench,系统评估 LLM 在 Tagalog、Filipino 和 Cebuano 等菲律宾语言上的表现。评测涵盖文化、NLP、阅读理解和生成四大类,结果显示 GPT-4o 表现最佳,而 SEA-LION 等区域模型在参数效率上具有优势。开源模型在成本效益上优于商业模型,但翻译任务仍是主要难点。
Hugging Face 在 Accelerate 和 Axolotl 中集成 ND-Parallel,提供 FSDP、TP、CP 及其组合的配置方法,帮助优化多节点大模型训练的显存与通信效率。
推荐理由:原文给出了多GPU并行策略的组合配置方法,读者可以据此优化大规模模型训练的显存与通信效率。
Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。
推荐理由:TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。
OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。
推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。
NVIDIA 发布开源 AI-Q 智能体栈,基于 Llama 3.3-70B 和 Llama-3.3-Nemotron-Super-49B-v1.5 模型,在 Hugging Face DeepResearch Bench 的 LLM with Search 类别中以 40.52 分登顶。该方案支持本地部署与隐私合规,提供完整的推理追踪与评估指标。
推荐理由:NVIDIA 开源 AI-Q 智能体栈并在 DeepResearch Bench 登顶,展示了 Llama Nemotron 在复杂推理任务中的能力。
Hugging Face 官方博客介绍 Gradio 新增 Model Context Protocol (MCP) 集成,可将 Python 函数自动转换为 LLM 工具。文章演示了如何利用该功能结合 IDM-VTON 模型和 Playwright,在 VS Code 中构建一个能自动浏览网页并生成虚拟试穿效果的 AI 购物助手。
推荐理由:Gradio 新增 MCP 支持可将 Python 函数自动转为 LLM 工具,本文演示了如何快速构建具备网页浏览与虚拟试穿能力的 AI 助手。
Hugging Face 发布开源实验追踪库 Trackio,提供兼容 wandb 的轻量级 Python 库,支持本地 Gradio 仪表盘及与 Hugging Face Spaces 同步分享。该工具内置与 Transformers 和 Accelerate 的集成,支持 GPU 能耗追踪,数据默认本地持久化并自动备份至 Parquet 数据集。
推荐理由:Trackio 提供兼容 wandb 的轻量级实验追踪方案,支持本地运行与 Spaces 同步,便于分享与数据提取。
Hugging Face 将 CLI 正式更名为 hf,重构命令结构以提升易用性,并推出 hf jobs 服务。hf jobs 支持在 Hugging Face 基础设施上按需运行脚本或 Docker 镜像,采用按秒计费的付费模式。该服务目前仅对 Pro 用户及 Team 或 Enterprise 组织开放。
Hugging Face 宣布 PyArrow 和 Pandas 现已支持 Parquet Content-Defined Chunking (CDC) 功能,配合 Xet 存储层可实现基于内容的数据去重。该功能通过减少 Parquet 文件在内容变更时的字节级差异,显著降低数据上传、下载及存储成本。
推荐理由:PyArrow 新增 Parquet CDC 功能配合 Xet 存储层,显著降低数据集上传下载与存储成本。
Hugging Face 发布 Flux 模型 LoRA 推理加速方案,结合 Flash Attention 3、torch.compile 和量化技术,在 H100 上实现 2.23 倍加速,在 RTX 4090 上实现 2.04 倍加速。
推荐理由:原文给出了结合Flash Attention 3、torch.compile和量化技术的LoRA热插拔方案,提供了可复用的优化方法。
NVIDIA 宣布 NIM 推理微服务现支持在 Hugging Face 上快速部署超过 10 万个大语言模型。NIM 提供单一 Docker 容器,自动识别模型格式并选择 TensorRT-LLM、vLLM 或 SGLang 后端,无需手动配置即可实现高性能部署。
推荐理由:NVIDIA NIM 提供统一容器自动适配 Hugging Face 模型,简化了部署流程。
Arc Institute发布虚拟细胞挑战赛,要求训练模型预测基因沉默对细胞的影响。Hugging Face博客详细解析了挑战赛的背景、数据集结构以及Arc提出的STATE基线模型,包括State Transition Model和State Embedding Model的架构设计。
Gradio 5.38.0 版本更新,增强了对 MCP 服务器协议的支持。新增功能包括:支持本地文件上传、实时进度通知、一行代码将 OpenAPI 规范转换为 MCP 服务器、通过 gr.Header 简化认证配置以及自定义工具描述。
推荐理由:Gradio 5.38.0 新增文件上传、OpenAPI 转换等 MCP 功能,降低了构建智能体应用的技术门槛。
Hugging Face 发布 FutureBench,旨在通过预测未来事件评估 AI 智能体的推理能力。该基准利用新闻和 Polymarket 数据生成问题,避免数据污染并提供可验证结果。初步测试显示,GPT-4.1、Claude 3.7 和 DeepSeek-V3 在信息搜集和推理策略上存在显著差异。
Consilium 是一个多 LLM 协作平台,让 AI 模型通过结构化辩论达成共识。该平台支持 MCP 协议集成,提供圆桌可视化界面及多种讨论模式。
Hugging Face 发布 Ettin 模型套件,包含 17M 至 1B 参数的编码器与解码器模型。该套件使用完全相同的 2T tokens 公开数据、架构和训练配方,实现了两种架构的公平对比。编码器在分类和检索任务上优于 ModernBERT,解码器在生成任务上优于 Llama 3.2 1B。
推荐理由:Ettin 提供完全一致的开源训练配方与数据,为对比编码器与解码器架构提供了公平基准。
Hugging Face 宣布将 Hub 全面迁移至 Xet 存储系统,目前已有超 100 万用户和 50 万个仓库使用。Xet 将成为新用户的默认存储,旧仓库将自动迁移,同时 Hugging Face 计划开源 Xet 协议及底层基础设施。
推荐理由:Hugging Face 宣布全面迁移至 Xet 存储,通过底层架构升级实现 PB 级数据的高效传输与无缝兼容。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商,支持 DeepSeek-R1 和 Flux.1 等模型。用户可在设置中配置 API Key 或选择由 HF 路由的请求,并通过 Python 和 JS SDK 无缝集成。PRO 用户每月可获得 2 美元推理额度,免费用户享有少量免费配额。
Fireworks.ai 正式成为 Hugging Face Hub 支持的推理提供商,用户可直接在模型页面及 HF 生态库中运行无服务器推理。支持 DeepSeek-R1、Llama-3.2-90B-Vision-Instruct 等模型,通过 Python 或 JS SDK 设置 provider 参数即可调用。
Hugging Face 引入 Math-Verify 解析器重测 Open LLM Leaderboard 全部 3,751 个模型,修正了旧版在格式提取、符号转换和数值比较上的缺陷。重测后模型平均得分提升 4.66 分,Qwen 和 DeepSeek 等模型分数大幅上涨,Nvidia AceMath 登顶 MATH-Hard 榜单。
推荐理由:Hugging Face 引入 Math-Verify 重测全量模型,修正了旧版解析缺陷,导致榜单排名大幅洗牌。
Hugging Face 发布文章,通过实测分析10亿级文本分类、嵌入及视觉嵌入推理的成本与延迟。使用Infinity服务器和k6工具,在NVIDIA L4等硬件上寻找最优Batch Size与并发数。结果显示文本分类10亿次成本约253美元,嵌入约409美元,而视觉嵌入因模型复杂和图像Token多,成本高达44496美元。
Hugging Face 发布用于构建视频生成数据集的开源工具与脚本,提供包含 yt-dlp 下载、多模型过滤(水印、美学、NSFW、运动)及 Florence-2 标注的三阶段流水线,并分享了 finetrainers/crush-smol-v0 等微调案例。
推荐理由:提供从下载、清洗到标注的完整视频数据集构建流程,帮助开发者高效准备视频生成模型训练数据。
Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。
推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。
Hugging Face 联合 2A2I 和 TII 发布 Open Arabic LLM Leaderboard 2。首版 OALL 上线不到 7 个月吸引超 46,000 访客,收录超 700 个模型。新版旨在解决资源限制与结果验证问题,提供更统一、透明的基准测试平台。
Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。
推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。
Hugging Face 开源了 smolagents 框架以复现 OpenAI Deep Research 的搜索智能体。该框架采用 CodeAgent 架构,在 GAIA 验证集上达到 55.15% 的成绩,优于此前开源方案。
推荐理由:Hugging Face 开源了复现 OpenAI Deep Research 的 smolagents 框架,展示了 CodeAgent 在 GAIA 基准上的性能提升。
Hugging Face 官方宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)模型接入 LeRobot 仓库。π0 基于流匹配实现 50Hz 实时动作生成,π0-FAST 引入 FAST 频域动作序列分词技术,训练速度提升 5 倍。
推荐理由:官方将π0和π0-FAST模型接入LeRobot,提供了从推理到微调的完整工程路径。