跳到正文
原文
Hugging Face Blog·· 2025-02-20精选AI 评分82

Hugging Face 发布 SmolVLM2 视频理解模型

SmolVLM2: Bringing Video Understanding to Every Device

AI 导读

Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 256M、500M 和 2.2B 三种参数规模。2.2B 模型在 Video-MME 基准上超越所有现有 2B 模型,500M 和 256M 模型在极低内存消耗下实现同等视频理解能力,且原生支持 Transformers 和 MLX 框架。

推荐理由

Hugging Face 开源了支持视频理解的 SmolVLM2 系列模型,提供 256M 至 2.2B 三种尺寸,兼顾端侧部署与前沿性能。

来源:Hugging Face Blog · huggingface.co