跳到正文

#多模态

今日 0 条
10月8日周四
10月7日周三
  1. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

  2. OpenAI News85

    GPT-6 伴随智能界面全球上线

    OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。

    推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。

  3. Simon Willison72

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,这是一个拥有 1 万亿参数、490 亿活跃参数的模型,通过 API 提供预览,并承诺月底开放权重。该模型支持“无”和“高”两种推理级别,在多模态图像生成上表现显著提升,在 Artificial Analysis 上得分 38,接近 DeepSeek 4.1 Flash。

10月6日周二
  1. Mistral AI92

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。

    推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。

8月10日周一
  1. Hugging Face Blog85

    Meta 发布 Muse Glimmer 30B 多模态模型

    Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。

    推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 系列气象预测模型

    Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。

    推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。

7月15日周三
  1. Hugging Face Blog86

    Thinking Machines 开源 Inkling 1T参数多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。

    推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。

6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

5月18日周一
  1. Google DeepMind92

    Google 发布 Gemini Omni Flash 多模态视频生成模型

    Google 发布 Gemini Omni Flash,支持将图像、音频、视频和文本作为输入生成高质量视频,并可通过自然语言对话进行编辑。该模型已面向 Google AI Plus、Pro 和 Ultra 订阅用户以及 YouTube Shorts 用户开放。

    推荐理由:原文给出了多模态输入生成视频的能力细节和开放入口,读者可以据此判断它对现有视频创作工作流的影响。

4月28日周二
  1. Hugging Face Blog83

    NVIDIA 开源 Nemotron 3 Nano Omni 多模态模型

    NVIDIA 在 Hugging Face 开源 Nemotron 3 Nano Omni 多模态理解模型,原生支持文档、图像、视频和音频的联合推理及智能体操作。该模型基于 Nemotron 3 混合 Mamba-Transformer 架构,在文档理解、视频分析和语音交互等基准测试中表现领先,并提供 BF16、FP8 和 NVFP4 权重下载。

    推荐理由:NVIDIA 开源 Nemotron 3 Nano Omni 模型,原生支持图文音视频多模态理解与智能体操作,在多项基准上表现领先。

4月13日周一
  1. Google DeepMind76

    Gemini Robotics-ER 1.6 发布,增强具身推理与仪表读取能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,显著增强空间推理、多视角理解及仪表读取能力。该模型支持通过 Gemini API 和 Google AI Studio 调用,具备通过代码执行与视觉推理实现高精度仪表读数,并提升了物理安全约束遵循能力。

    推荐理由:新增仪表读取与多视角推理能力,为具身智能体提供可验证的物理世界交互方案。

3月17日周二
  1. Mistral AI88

    Mistral 发布 Mistral Small 4 统一模型

    Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。

    推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。

3月4日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.1 Flash-Lite 模型

    Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。

    推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。

1月5日周一
  1. Hugging Face Blog62

    TII 发布 Falcon-H1-Arabic 系列模型

    TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。

    推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。

12月17日周三
  1. Google DeepMind93

    Google 发布 Gemini 3 Flash 模型

    Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。

    推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。

12月3日周三
  1. Mistral AI88

    Mistral AI 发布 Mistral 3 模型家族

    Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。

    推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。

11月19日周三
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3 Pro 模型

    Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。

    推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。

9月9日周二
  1. Hugging Face Blog82

    Hugging Face 发布 mmBERT 多语言模型

    Hugging Face 发布 mmBERT,基于 ModernBERT 架构训练的多语言编码器模型,覆盖 1800 多种语言,在 XTREME 和 MTEB 基准上显著超越 XLM-R 等前代模型。该模型采用三阶段渐进式语言学习策略,在 3T+ tokens 数据上训练,推理速度提升 2-4 倍,并开源了模型权重、训练数据及微调代码。

    推荐理由:开源了覆盖1800种语言的现代BERT架构模型,提供了显著的性能与速度提升及微调代码。

2月17日周一
  1. Mistral AI70

    Mistral Saba 发布,首款面向中东与南亚的区域语言模型

    Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚语言(如阿拉伯语、泰米尔语)进行了优化。该模型在区域语言任务上表现优于大 5 倍的通用模型,支持 API 调用及单 GPU 本地部署,速度超过 150 tokens/秒。

    推荐理由:原文给出了24B参数模型在阿拉伯语等区域语言上的性能优势及本地部署能力,读者可据此评估区域化定制方案。

11月18日周一
  1. Mistral AI85

    Mistral 发布 Pixtral Large 多模态模型并更新 Mistral Large

    Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。

    推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。

9月17日周二
  1. Mistral AI85

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。

    推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。

7月24日周三
  1. Mistral AI88

    Mistral Large 2 发布,支持单节点部署与增强推理能力

    Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。

    推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。