Hugging Face 发布视频生成数据集构建工具与脚本
Hugging Face 发布用于构建视频生成数据集的开源工具与脚本,提供包含 yt-dlp 下载、多模型过滤(水印、美学、NSFW、运动)及 Florence-2 标注的三阶段流水线,并分享了 finetrainers/crush-smol-v0 等微调案例。
推荐理由:提供从下载、清洗到标注的完整视频数据集构建流程,帮助开发者高效准备视频生成模型训练数据。
Hugging Face 发布用于构建视频生成数据集的开源工具与脚本,提供包含 yt-dlp 下载、多模型过滤(水印、美学、NSFW、运动)及 Florence-2 标注的三阶段流水线,并分享了 finetrainers/crush-smol-v0 等微调案例。
推荐理由:提供从下载、清洗到标注的完整视频数据集构建流程,帮助开发者高效准备视频生成模型训练数据。
Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。
推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。
Hugging Face 联合 2A2I 和 TII 发布 Open Arabic LLM Leaderboard 2。首版 OALL 上线不到 7 个月吸引超 46,000 访客,收录超 700 个模型。新版旨在解决资源限制与结果验证问题,提供更统一、透明的基准测试平台。
Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。
推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。
Hugging Face 开源了 smolagents 框架以复现 OpenAI Deep Research 的搜索智能体。该框架采用 CodeAgent 架构,在 GAIA 验证集上达到 55.15% 的成绩,优于此前开源方案。
推荐理由:Hugging Face 开源了复现 OpenAI Deep Research 的 smolagents 框架,展示了 CodeAgent 在 GAIA 基准上的性能提升。
Hugging Face 官方宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)模型接入 LeRobot 仓库。π0 基于流匹配实现 50Hz 实时动作生成,π0-FAST 引入 FAST 频域动作序列分词技术,训练速度提升 5 倍。
推荐理由:官方将π0和π0-FAST模型接入LeRobot,提供了从推理到微调的完整工程路径。
Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。
推荐理由:文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。
Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。
推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。
Hugging Face 与 AWS 合作提供指南,展示如何在 AWS 服务上部署和微调 DeepSeek R1 模型。开发者可通过 Hugging Face Inference Endpoints 以每小时 8.3 美元的价格部署量化版 DeepSeek R1 及 6 个蒸馏模型,或利用 Amazon SageMaker AI 配合 Hugging Face LLM DLCs 进行部署与微调。
Hugging Face 发布 Open-R1 项目,旨在系统复现 DeepSeek-R1 的数据收集与纯强化学习训练流程。项目计划通过蒸馏高质量推理数据集、构建数学与代码数据集,并开源多阶段训练配方,以验证并推广推理模型技术。
推荐理由:Hugging Face 宣布启动开源复现项目,旨在公开 DeepSeek-R1 的训练数据与代码,推动推理模型技术透明化。
Hugging Face Diffusers团队发布文章梳理开源视频生成模型现状,提供HunyuanVideo、CogVideoX等模型在Diffusers中的内存优化基准与微调代码。
推荐理由:文章系统梳理了开源视频模型现状,并提供了Diffusers内存优化与微调的具体代码和基准数据。
Hugging Face 在 smolagents 中新增对视觉语言模型(VLM)的原生支持,允许在智能体管道中直接使用视觉能力。通过提供初始图像输入和基于回调的动态截图机制,开发者可轻松构建如自主网页浏览等视觉智能体。
推荐理由:原生支持视觉模型并给出动态截图回调示例,便于开发者快速构建具备视觉能力的智能体。
Hugging Face 发布 SmolVLM 256M 和 500M 两个新模型,其中 256M 参数版本号称全球最小视觉语言模型。新模型采用更小的 SigLIP 视觉编码器和优化的 Tokenization 技术,支持 Transformers、MLX 和 ONNX 格式,旨在降低端侧和消费级设备的运行成本。
推荐理由:Hugging Face 发布 SmolVLM 256M 和 500M 模型,在保持轻量级的同时提供多模态能力,适合端侧部署。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成至 Hugging Face Hub 的“Deploy this model”按钮中。
Mistral AI 宣布与法新社(AFP)达成全球合作,Le Chat 将接入 AFP 新闻稿以增强事实准确性。该集成支持法语、英语等六种语言,利用 AFP 每日 2,300 条新闻内容,确保回复基于可靠且最新的资讯。此项功能将在未来几周向所有 Le Chat 用户推出。
Hugging Face 发布 TimmWrapper,将 PyTorch Image Models (timm) 集成至 transformers 生态,支持 Pipeline API、Auto Classes、8bit 量化、Trainer 微调及 torch.compile 加速。
推荐理由:Hugging Face 官方发布 TimmWrapper 实现 timm 与 transformers 生态互通,支持量化、微调与编译加速。
Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。
推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。
Hugging Face 发布 sentence-transformers/static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1 两个静态嵌入模型,在 CPU 上比主流模型快 100-400 倍,同时保持 85% 以上的性能。文章公开了基于对比学习和 Matryoshka 表示学习的完整训练策略、数据集选择及代码实现。
推荐理由:Hugging Face 开源了基于静态嵌入的高效模型及完整训练代码,为低延迟和端侧部署提供了可复用的实践方案。
Hugging Face发布博客,从伦理视角系统分析AI智能体的自主性分级与多维价值权衡。文章指出风险随自主性增加而上升,建议不开发全自主智能体,并推荐半自主智能体。
推荐理由:文章从伦理视角系统拆解了AI智能体的自主性分级与多维价值权衡,并明确建议不开发全自主智能体。
Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索模型及 vdr-2b-v1 英文版,支持无需 OCR 直接检索多语言文档。模型基于 50 万高质量合成样本训练,在 ViDoRe 基准测试中表现优异,支持 Matryoshka 表示学习与二值量化以实现高效检索。
推荐理由:开源多语言视觉文档检索模型及50万样本数据集,支持跨语言检索与高效向量压缩。
Hugging Face基于Open LLM Leaderboard评估的3000多个模型,量化了模型推理阶段的CO₂排放。研究发现,社区微调模型通常比官方基座模型更具碳效率,这主要归因于微调减少了输出冗余和重复模式,从而降低了推理时的计算开销。
Hugging Face 发布 smolagents 库,支持模型通过编写代码来调用工具,简化了智能体开发流程。该库兼容 Hugging Face Hub 及 OpenAI、Anthropic 等外部模型,并展示了开源模型在智能体工作流中具备与顶级闭源模型竞争的能力。
推荐理由:Hugging Face 推出 smolagents 库,通过让模型直接编写代码来调用工具,简化了智能体开发并提升了开源模型表现。
Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。
推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。
NVIDIA发布LogitsProcessorZoo,提供模块化组件以直接修改语言模型的Logits分布。
推荐理由:原文详解NVIDIA LogitsProcessorZoo的四个核心处理器,提供代码示例展示如何控制生成长度、强制引用和格式。
Artificial Analysis 发布 Big Bench Audio 数据集,评估语音语言模型的推理能力。测试显示 GPT-4o 在语音到语音任务中准确率仅为 66%,远低于文本处理的 92%,传统语音转文本再转语音的流水线方案在推理准确性上目前优于原生语音模型。
推荐理由:首次量化语音推理性能衰减,揭示原生语音模型在复杂推理任务中显著落后于文本处理。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一款基于 Transformer 架构的编码器模型,包含 Base(1.49 亿参数)和 Large(3.95 亿参数)两个版本。
推荐理由:ModernBERT 将上下文窗口扩展至 8192 并大幅提升推理速度,为 RAG 和代码检索提供了更高效的开源替代方案。
IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。
推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。
TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。
推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。
在 Google Cloud 的 5代 Xeon C4 实例上,文本嵌入吞吐量比 N2 高 10-24 倍,文本生成高 2.3-3.6 倍。C4 每小时价格约为 N2 的 1.3 倍,在文本嵌入和生成任务中分别保持 7-19 倍和 1.7-2.9 倍的 TCO 优势。
Hugging Face 发布合成数据生成器,用户可通过自然语言描述零代码生成文本分类和对话数据集,并支持使用 AutoTrain 直接微调模型。工具基于 distilabel 和 Hugging Face API,提供网页应用、私有部署及 Apache 2.0 开源代码。
推荐理由:Hugging Face 推出零代码合成数据生成器,打通从自然语言描述到模型微调的完整工作流。
Entalpic 与 Hugging Face 联合发布 LeMaterial 开源项目,旨在通过统一清洗材料数据加速机器学习驱动的材料发现。首期发布的 LeMat-Bulk 数据集整合了 Materials Project、Alexandria 和 OQMD 三大数据库,提供 6.7M 条标准化条目及 7 种材料属性。
Hugging Face 社区发布了面向文本到图像生成的开源偏好数据集,包含 1 万对偏好样本,涵盖多种图像风格与提示词复杂度。数据集采用 Apache 2.0 协议,附带用于数据预处理和后处理的代码,并提供了基于 FLUX.1-dev 模型的 LoRA 微调适配器。
推荐理由:开源了文本到图像生成的偏好数据集及微调代码,为社区提供了可复用的训练素材。
Hugging Face 的 83 款开源模型现可通过 Amazon Bedrock Marketplace 部署,底层由 Amazon SageMaker Jumpstart 管理。
Google 发布 PaliGemma 2 视觉语言模型,基于 SigLIP 和 Gemma 2 架构,提供 3B、10B 和 28B 三种参数规模,支持 224x224、448x448 和 896x896 多种输入分辨率。模型采用 Gemma 许可协议,支持商业使用与微调,Hugging Face 同步更新了 transformers 集成与 LoRA 微调脚本。
推荐理由:提供了多尺寸模型与多分辨率支持,并附带微调脚本,便于开发者快速适配视觉语言任务。
AraGen Benchmark 发布,推出基于 3C3H 评估框架的阿拉伯语 LLM 排行榜。该框架通过 LLM-as-a-Judge 从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度综合评估模型的事实准确性与可用性。排行榜采用动态评估策略,数据集每三个月轮换一次以防范数据污染。
Capital Fund Management 利用 Llama 3.1 辅助标注和 Argilla 平台优化金融数据命名实体识别,将 GLiNER 和 SpanMarker 微调后 F1 分数分别提升至 93.4% 和 90.1%。该方案推理成本较大型 LLM 降低高达 80 倍,实现了准确性与成本效益的平衡。
Hugging Face发布指南解读欧盟AI法案对开源开发者的合规要求,涵盖有限风险AI系统的披露义务及非系统性风险GPAI模型的训练数据摘要与版权合规,并推荐了平台上的相关工具。
推荐理由:文章梳理了欧盟AI法案对开源开发者的合规要求,并提供了Hugging Face平台上的实用工具指引。
Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。
Hugging Face 发布 SmolVLM,一款 2B 参数、完全开源的视觉语言模型。该模型采用像素重排策略将视觉信息压缩 9 倍,在同等规模下显存占用最低且推理速度最快。提供 Base、Synthetic 和 Instruct 三个版本,支持本地部署与微调。
推荐理由:SmolVLM 通过像素重排策略大幅压缩视觉 Token,在同等规模下实现更低的显存占用和更高的推理速度。
本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。