跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

128条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 128 条
12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

12月5日周四
  1. Hugging Face Blog79

    Google 发布 PaliGemma 2 多模态模型

    Google 发布 PaliGemma 2 视觉语言模型,基于 SigLIP 和 Gemma 2 架构,提供 3B、10B 和 28B 三种参数规模,支持 224x224、448x448 和 896x896 多种输入分辨率。模型采用 Gemma 许可协议,支持商业使用与微调,Hugging Face 同步更新了 transformers 集成与 LoRA 微调脚本。

    推荐理由:提供了多尺寸模型与多分辨率支持,并附带微调脚本,便于开发者快速适配视觉语言任务。

11月26日周二
  1. Hugging Face Blog75

    Hugging Face 发布 SmolVLM 2B 多模态模型

    Hugging Face 发布 SmolVLM,一款 2B 参数、完全开源的视觉语言模型。该模型采用像素重排策略将视觉信息压缩 9 倍,在同等规模下显存占用最低且推理速度最快。提供 Base、Synthetic 和 Instruct 三个版本,支持本地部署与微调。

    推荐理由:SmolVLM 通过像素重排策略大幅压缩视觉 Token,在同等规模下实现更低的显存占用和更高的推理速度。

11月18日周一
  1. Mistral AI70

    Mistral le Chat 更新搜索、Canvas 与 Agent 功能

    Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。

    推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。

  2. Mistral AI85

    Mistral 发布 Pixtral Large 多模态模型并更新 Mistral Large

    Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。

    推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。

10月24日周四
  1. Hugging Face Blog75

    Cohere 发布 Aya Expanse 多语言大模型

    Cohere For AI 发布 Aya Expanse 系列多语言大语言模型,包含 8B 和 32B 参数版本,并在 Hugging Face 开源权重。

    推荐理由:Aya Expanse 通过数据套利与模型融合等创新训练策略,在多项多语言评测中超越 Llama 3.1 等主流模型,为多语言大模型训练提供了新的技术路径。

10月1日周二
9月23日周一
  1. Hugging Face Blog68

    Hugging Face 发布 FineVideo 数据集及构建管线

    Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。

    推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。

9月17日周二
  1. Mistral AI85

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。

    推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。

9月16日周一
  1. Hugging Face Blog65

    HuggingChat 发布社区工具功能

    HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。

    推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

7月23日周二
7月10日周三
  1. Hugging Face Blog72

    使用TRL库通过DPO微调多模态模型

    Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。

    推荐理由:文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。

6月24日周一
  1. Hugging Face Blog68

    Hugging Face 博客:微调 Microsoft Florence-2 视觉语言模型

    Hugging Face 博客发布教程,展示如何在受限资源下微调 Microsoft Florence-2 视觉语言模型。文章通过 DocVQA 数据集实验,验证了冻结视觉编码器并使用小学习率(1e-6)微调的有效性,验证集 Levenshtein 相似度从 0 提升至 57.0,并提供了 Colab 笔记本与完整代码。

    推荐理由:提供在受限资源下微调 Florence-2 的完整代码与实验数据,展示如何将其适配至文档问答等下游任务。

5月24日周五
  1. Hugging Face Blog67

    TII 发布 Falcon 2 11B 语言模型与多模态模型

    TII 发布 Falcon 2 系列模型,包含 11B 参数语言模型与视觉语言模型(VLM),均在 5000B tokens 数据上训练。11B LLM 在多项基准上超越 Llama3-8B 和 Mistral-7B,支持 11 种语言;11B VLM 集成 CLIP 视觉编码器,在 MME 等基准上表现优异。模型采用 Apache 2.0 衍生许可开源。

    推荐理由:Falcon 2 提供 11B 参数语言模型与视觉语言模型,兼顾多语言与代码能力,为端侧部署提供高性价比选择。

5月16日周四
5月14日周二
  1. Hugging Face Blog83

    Google 发布开源视觉语言模型 PaliGemma

    Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。

    推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。

5月13日周一