跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

133条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–133 条 · 共 133 条
5月14日周二
  1. Hugging Face Blog83

    Google 发布开源视觉语言模型 PaliGemma

    Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。

    推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。

5月13日周一
4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

4月15日周一
4月11日周四
  1. Hugging Face Blog68

    Hugging Face 详解视觉语言模型原理与微调实践

    Hugging Face 发布视觉语言模型(VLM)科普与实战指南,涵盖模型原理、主流开源模型概览及选型方法。文章重点介绍了基于最新 TRL 库使用 SFTTrainer 对 LLaVA 等模型进行指令微调的完整代码流程。

    推荐理由:文章系统梳理了开源视觉语言模型生态,并提供了基于最新TRL库进行微调的完整代码示例。

2月15日周四
  1. OpenAI News93

    Sora:将视频生成模型作为世界模拟器

    OpenAI 发布研究论文,探讨在视频数据上大规模训练生成模型。其最大模型 Sora 采用时空 patch 的 Transformer 架构,能够生成长达一分钟的高保真视频,表明扩展视频生成模型是构建通用物理世界模拟器的有前景路径。

    推荐理由:文章提出将视频生成模型作为世界模拟器,并展示了Sora生成长视频的能力,为物理世界模拟提供了新路径。

11月6日周一
9月25日周一
3月14日周二
  1. OpenAI News95

    OpenAI发布GPT-4多模态模型

    OpenAI发布GPT-4,这是一个接受图像和文本输入并输出文本的大型多模态模型。该模型在各类专业和学术基准测试中展现出人类水平的表现。

    推荐理由:原文确立了GPT-4作为多模态大模型的地位,并给出了其在专业基准上达到人类水平的初步能力评估。

7月12日周二
  1. Hugging Face Blog77

    Hugging Face 发布全球最大开源多语言大模型 BLOOM

    Hugging Face 发布全球最大开源多语言大语言模型 BLOOM,拥有 1760 亿参数,支持 46 种自然语言和 13 种编程语言。该模型由 1000 多名研究人员历时 117 天训练完成,首次开源了完整的训练检查点和优化器状态,并提供基于 TPU 的推理 API 供社区测试。

    推荐理由:开源了1760亿参数多语言模型及训练检查点,为研究大模型内部机制提供了完整的透明数据。

1月5日周二
  1. OpenAI News60

    CLIP: Connecting text and images

    OpenAI 发布 CLIP 模型,该神经网络通过自然语言监督高效学习视觉概念,可像 GPT-2 和 GPT-3 一样实现零样本视觉分类。

    推荐理由:提出利用自然语言监督高效学习视觉概念的方法,展示了类似GPT的零样本分类能力。