跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 71 条
8月17日周一
  1. Google Research70

    Google Research 提出 PhotoScan 利用智能手机图像估算体成分与代谢风险

    Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。

    推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。

8月13日周四
  1. Hugging Face Blog72

    OlmoEarth Studio 开放自定义嵌入向量导出功能

    OlmoEarth Studio 现支持计算并导出自定义嵌入向量,生成轻量级 Cloud-Optimized GeoTIFF (COG) 文件。用户可通过 Studio UI 或 API 选择感兴趣区域、时间范围、编码器变体(Nano/Tiny/Base)及影像源,获取用于相似度搜索、少样本分割、变化检测和 PCA 探索的嵌入数据。

    推荐理由:OlmoEarth Studio 开放自定义嵌入向量导出,提供轻量级 COG 格式及下游应用示例,便于直接复用。

8月12日周三
  1. Google DeepMind85

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。

    推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。

  2. Google Research88

    Google 发布 AMIE 实时视频问诊研究:达到专家级临床诊断水平

    Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。

    推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。

8月10日周一
  1. Hugging Face Blog85

    Meta 发布 Muse Glimmer 30B 多模态模型

    Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。

    推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 系列气象预测模型

    Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。

    推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。

7月30日周四
  1. Google DeepMind83

    Gemini Robotics ER 2 发布,升级视频理解与多机协作

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机协作能力。模型通过 Gemini Live API 提供低延迟流式推理,支持进度分类与关键帧定位,开发者可通过 Gemini API 接入。

    推荐理由:模型升级视频理解与多机协作能力,提供 Gemini API 入口,开发者可据此评估物理智能体的任务编排潜力。

7月28日周二
  1. Google DeepMind85

    Google DeepMind 发布 Gemini Robotics 2 智能体模型

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA、ER 和端侧三大模型,赋予机器人全身控制、精细操作与多机协作能力。Gemini Robotics ER 2 已在 Google AI Studio 开放,VLA 模型面向早期合作伙伴。

    推荐理由:原文给出了三大模型的能力边界与开放入口,读者可据此评估其在复杂物理任务中的实际落地价值。

7月15日周三
  1. Hugging Face Blog86

    Thinking Machines 开源 Inkling 1T参数多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。

    推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。

7月9日周四
  1. Google Research86

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布 SensorFM,一个基于超一万亿分钟无标签多模态传感器数据训练的可穿戴健康基础模型。该模型在心血管、代谢、睡眠等35项健康任务中展现出泛化能力,并支持通过智能体自动构建预测头及作为个人健康智能体的底层支撑。

    推荐理由:基于万亿分钟无标签数据训练通用表示,为可穿戴设备健康分析提供了可扩展的底层方案。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

6月5日周五
  1. Google Research68

    Google Research 发布基于手机摄像头的被动心率监测研究

    Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。

    推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。

  2. Hugging Face Blog84

    NVIDIA 发布 Nemotron 3.5 内容安全模型,支持多模态与自定义策略

    NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。

    推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。

6月4日周四
  1. Google Research70

    Google 开源水文模型框架,赋能全球洪水预报

    Google Research 在 GitHub 开源了驱动 Flood Hub 的水文模型框架,允许气象机构利用本地数据微调模型。该框架包含基于 LSTM 的模型架构和训练管线,升级模型将可靠预测期延长了六天。

    推荐理由:开源了驱动 Flood Hub 的 AI 水文模型框架,允许气象机构利用本地数据微调模型,提升洪水预报能力。

5月29日周五
5月18日周一
  1. Google DeepMind92

    Google 发布 Gemini Omni Flash 多模态视频生成模型

    Google 发布 Gemini Omni Flash,支持将图像、音频、视频和文本作为输入生成高质量视频,并可通过自然语言对话进行编辑。该模型已面向 Google AI Plus、Pro 和 Ultra 订阅用户以及 YouTube Shorts 用户开放。

    推荐理由:原文给出了多模态输入生成视频的能力细节和开放入口,读者可以据此判断它对现有视频创作工作流的影响。

5月12日周二
  1. Google DeepMind80

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 发布 Co-Scientist,这是一个基于 Gemini 的多智能体 AI 系统,旨在通过生成、辩论和进化假设来加速科学研究。该系统包含生成、辩论和进化三个阶段,利用“思想锦标赛”机制对假设进行交叉验证和排名,目前已通过 Hypothesis Generation 工具向研究人员开放。

    推荐理由:原文披露了基于 Gemini 的多智能体协作机制与“思想锦标赛”验证流程,为科研场景下的 AI 智能体提供了可迁移的方法论。

4月30日周四
  1. Google DeepMind73

    Google DeepMind 发布 AI co-clinician 研究:实时多模态医疗辅助能力评估

    Google DeepMind 发布 AI co-clinician 研究,探索 AI 智能体在医生监督下辅助患者的“三元护理”模式。研究通过 120 次模拟远程问诊对比 GPT-realtime,发现 AI 在 140 项评估指标中 68 项优于初级全科医生,但在识别红旗症状等关键判断上仍不及专家。

    推荐理由:通过对比GPT-realtime等前沿模型,验证了AI在实时多模态问诊中的能力边界与临床辅助价值。