Google 发布开源视觉语言模型 PaliGemma
Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。
推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。
推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。
OpenAI 发布 GPT-4 Omni 旗舰模型,支持在音频、视觉和文本之间进行实时推理。
推荐理由:GPT-4 Omni 支持实时跨音频、视觉和文本推理,为多模态交互提供了新的技术基准。
OpenAI 发布 GPT-4o 模型,并宣布在 ChatGPT 中提供更多免费能力。
推荐理由:GPT-4o 发布并开放 ChatGPT 免费使用,读者可据此评估多模态模型在通用场景的可用性。
OpenAI 发布最新旗舰模型 GPT-4o,并宣布在 ChatGPT 免费用户中开放更多功能。
推荐理由:GPT-4o 作为最新旗舰模型上线,同时 ChatGPT 免费用户获得更多功能,直接改变免费用户的可用能力边界。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Hugging Face 发布 Idefics2,一款基于 Mistral-7B 和 SigLIP 的 8B 参数开源多模态模型,采用 Apache 2.0 许可证。
推荐理由:开源8B多模态模型在多项基准上超越更大参数模型,提供完整权重与微调数据集,降低多模态应用门槛。
Hugging Face 发布视觉语言模型(VLM)科普与实战指南,涵盖模型原理、主流开源模型概览及选型方法。文章重点介绍了基于最新 TRL 库使用 SFTTrainer 对 LLaVA 等模型进行指令微调的完整代码流程。
推荐理由:文章系统梳理了开源视觉语言模型生态,并提供了基于最新TRL库进行微调的完整代码示例。
OpenAI 发布研究论文,探讨在视频数据上大规模训练生成模型。其最大模型 Sora 采用时空 patch 的 Transformer 架构,能够生成长达一分钟的高保真视频,表明扩展视频生成模型是构建通用物理世界模拟器的有前景路径。
推荐理由:文章提出将视频生成模型作为世界模拟器,并展示了Sora生成长视频的能力,为物理世界模拟提供了新路径。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo(含 128K 上下文窗口及更低价格)、新 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API。
推荐理由:原文列出了GPT-4 Turbo、新API及DALL·E 3等具体更新,读者可据此评估对现有开发工作流的影响。
ChatGPT 新增视觉、听觉和语音交互能力。
推荐理由:标题明确指出了ChatGPT新增视觉、听觉和语音交互能力,标志着产品向多模态交互演进。
OpenAI发布GPT-4,这是一个接受图像和文本输入并输出文本的大型多模态模型。该模型在各类专业和学术基准测试中展现出人类水平的表现。
推荐理由:原文确立了GPT-4作为多模态大模型的地位,并给出了其在专业基准上达到人类水平的初步能力评估。
Hugging Face 发布全球最大开源多语言大语言模型 BLOOM,拥有 1760 亿参数,支持 46 种自然语言和 13 种编程语言。该模型由 1000 多名研究人员历时 117 天训练完成,首次开源了完整的训练检查点和优化器状态,并提供基于 TPU 的推理 API 供社区测试。
推荐理由:开源了1760亿参数多语言模型及训练检查点,为研究大模型内部机制提供了完整的透明数据。
OpenAI 发布 CLIP 模型,该神经网络通过自然语言监督高效学习视觉概念,可像 GPT-2 和 GPT-3 一样实现零样本视觉分类。
推荐理由:提出利用自然语言监督高效学习视觉概念的方法,展示了类似GPT的零样本分类能力。