使用TRL库通过DPO微调多模态模型
Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。
推荐理由:文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。
推荐理由:文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。
Hugging Face 博客发布教程,展示如何在受限资源下微调 Microsoft Florence-2 视觉语言模型。文章通过 DocVQA 数据集实验,验证了冻结视觉编码器并使用小学习率(1e-6)微调的有效性,验证集 Levenshtein 相似度从 0 提升至 57.0,并提供了 Colab 笔记本与完整代码。
推荐理由:提供在受限资源下微调 Florence-2 的完整代码与实验数据,展示如何将其适配至文档问答等下游任务。
TII 发布 Falcon 2 系列模型,包含 11B 参数语言模型与视觉语言模型(VLM),均在 5000B tokens 数据上训练。11B LLM 在多项基准上超越 Llama3-8B 和 Mistral-7B,支持 11 种语言;11B VLM 集成 CLIP 视觉编码器,在 MME 等基准上表现优异。模型采用 Apache 2.0 衍生许可开源。
推荐理由:Falcon 2 提供 11B 参数语言模型与视觉语言模型,兼顾多语言与代码能力,为端侧部署提供高性价比选择。
ChatGPT 更新数据分析功能,支持直接添加 Google Drive 和 Microsoft OneDrive 文件,并增强与表格和图表的交互能力。
推荐理由:ChatGPT 新增云端文件直传与图表交互能力,扩展了多模态处理范围。
OpenAI 宣布与 Reddit 达成合作,计划将 Reddit 的独特内容引入 ChatGPT 及其产品。
推荐理由:OpenAI 官方宣布与 Reddit 达成合作,将 Reddit 内容引入 ChatGPT,为理解大模型数据源拓展提供了直接依据。
Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。
推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。
OpenAI 发布 GPT-4 Omni 旗舰模型,支持在音频、视觉和文本之间进行实时推理。
推荐理由:GPT-4 Omni 支持实时跨音频、视觉和文本推理,为多模态交互提供了新的技术基准。
OpenAI 发布 GPT-4o 模型,并宣布在 ChatGPT 中提供更多免费能力。
推荐理由:GPT-4o 发布并开放 ChatGPT 免费使用,读者可据此评估多模态模型在通用场景的可用性。
OpenAI 发布最新旗舰模型 GPT-4o,并宣布在 ChatGPT 免费用户中开放更多功能。
推荐理由:GPT-4o 作为最新旗舰模型上线,同时 ChatGPT 免费用户获得更多功能,直接改变免费用户的可用能力边界。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Hugging Face 发布 Idefics2,一款基于 Mistral-7B 和 SigLIP 的 8B 参数开源多模态模型,采用 Apache 2.0 许可证。
推荐理由:开源8B多模态模型在多项基准上超越更大参数模型,提供完整权重与微调数据集,降低多模态应用门槛。
Hugging Face 发布视觉语言模型(VLM)科普与实战指南,涵盖模型原理、主流开源模型概览及选型方法。文章重点介绍了基于最新 TRL 库使用 SFTTrainer 对 LLaVA 等模型进行指令微调的完整代码流程。
推荐理由:文章系统梳理了开源视觉语言模型生态,并提供了基于最新TRL库进行微调的完整代码示例。
Mistral AI 发布最新旗舰语言模型 Mistral Large,该模型原生支持英法西德意五语,具备 32K 上下文窗口、函数调用及 JSON 格式输出能力,在 MMLU 等基准测试中表现优异,并可通过 Azure 获取。同时发布针对低延迟优化的 Mistral Small 模型,两者均支持函数调用与结构化输出功能。
推荐理由:Mistral 发布旗舰模型并公布多项基准测试成绩,同时推出轻量模型与 API 功能,便于开发者评估选型。
OpenAI 发布研究论文,探讨在视频数据上大规模训练生成模型。其最大模型 Sora 采用时空 patch 的 Transformer 架构,能够生成长达一分钟的高保真视频,表明扩展视频生成模型是构建通用物理世界模拟器的有前景路径。
推荐理由:文章提出将视频生成模型作为世界模拟器,并展示了Sora生成长视频的能力,为物理世界模拟提供了新路径。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo(含 128K 上下文窗口及更低价格)、新 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API。
推荐理由:原文列出了GPT-4 Turbo、新API及DALL·E 3等具体更新,读者可据此评估对现有开发工作流的影响。
ChatGPT 新增视觉、听觉和语音交互能力。
推荐理由:标题明确指出了ChatGPT新增视觉、听觉和语音交互能力,标志着产品向多模态交互演进。
Hugging Face 发布开源多模态模型 IDEFICS,复现 DeepMind 未公开的 Flamingo 架构,支持任意图文序列输入并生成文本。模型提供 9B 和 80B 两种参数规模,以及针对对话场景微调的指令版本,基于 LLaMA v1 和 OpenCLIP 构建,使用公开数据及自研 OBELICS 数据集训练。
推荐理由:开源复现 DeepMind Flamingo 架构,提供 9B 和 80B 两种参数规模及指令微调版,支持图文序列输入。
OpenAI发布GPT-4,这是一个接受图像和文本输入并输出文本的大型多模态模型。该模型在各类专业和学术基准测试中展现出人类水平的表现。
推荐理由:原文确立了GPT-4作为多模态大模型的地位,并给出了其在专业基准上达到人类水平的初步能力评估。
Hugging Face 发布全球最大开源多语言大语言模型 BLOOM,拥有 1760 亿参数,支持 46 种自然语言和 13 种编程语言。该模型由 1000 多名研究人员历时 117 天训练完成,首次开源了完整的训练检查点和优化器状态,并提供基于 TPU 的推理 API 供社区测试。
推荐理由:开源了1760亿参数多语言模型及训练检查点,为研究大模型内部机制提供了完整的透明数据。
OpenAI 发布 CLIP 模型,该神经网络通过自然语言监督高效学习视觉概念,可像 GPT-2 和 GPT-3 一样实现零样本视觉分类。
推荐理由:提出利用自然语言监督高效学习视觉概念的方法,展示了类似GPT的零样本分类能力。