跳到正文

#多模态

今日 5 条
今天10月9日周五
  1. The Decoder85

    ChatGPT 搭载 GPT-6 推出交互式 UI 功能

    OpenAI 向 ChatGPT 用户全面推送 GPT-6,引入“智能 UI”功能,将回答转化为包含图表、按钮和迷你应用的交互式界面。该模型支持在“思考”过程中同时输出内容,使等待时间缩短 44%,Plus 及以上用户今日即可使用。

    推荐理由:GPT-6 引入交互式 UI 与流式思考功能,显著缩短响应时间,为 ChatGPT 交互形态带来实质性变化。

  2. TechCrunch · AI85

    ChatGPT 随 GPT-6 发布交互式智能界面

    OpenAI 随 GPT-6 模型发布 ChatGPT 智能界面(Intelligent UI),将交互式图表、可点击按钮和定制计算器等视觉元素整合进对话中。该功能面向 Pro、Plus、Business 和 Enterprise 用户周三全球上线,周四扩展至免费及 Go 层级用户。

    推荐理由:GPT-6 引入交互式图表和可操作组件,将改变 ChatGPT 从纯文本向多模态交互的演进方向。

  3. The Verge · AI85

    ChatGPT 随 GPT-6 上线智能界面功能

    OpenAI 在 ChatGPT 中推出智能界面功能,允许模型在回复中生成图表、表单和可点击按钮等交互元素。该功能随 GPT-6 模型向 Plus、Pro 等付费用户开放,并将于周四扩展至免费用户。

    推荐理由:GPT-6 引入可交互图表与工具生成能力,为复杂任务提供了更直观的交互方式。

10月8日周四
10月7日周三
  1. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

  2. OpenAI News85

    GPT-6 伴随智能界面全球上线

    OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。

    推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。

  3. Simon Willison40

    llm-openai-decisions 0.1a0 发布

    OpenAI 发布 Jev-style Decisions API,支持 gpt-6-luna 模型进行图像和文本决策推理。该模型输入定价为每百万 token 10 美分,支持 yes/no、choices 和 scores 三种问题类型。llm-openai-decisions 0.1a0 插件已上线,可通过 llm install 命令安装使用。

  4. Simon Willison72

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,这是一个拥有 1 万亿参数、490 亿活跃参数的模型,通过 API 提供预览,并承诺月底开放权重。该模型支持“无”和“高”两种推理级别,在多模态图像生成上表现显著提升,在 Artificial Analysis 上得分 38,接近 DeepSeek 4.1 Flash。

10月6日周二
  1. Google Research73

    Google 发布地球AI人口动态基础模型PDFM

    Google Research 发布地球AI人口动态基础模型PDFM,将搜索趋势、环境等隐私数据压缩为位置嵌入。该模型在麻疹疫苗、心血管疾病、登革热、产后抑郁和霍乱预测中验证了提升效果,并作为Population Dynamics Insights在Google Maps Platform开放预览。

    推荐理由:原文展示了PDFM在五大公共卫生场景的实测增益,读者可评估其作为现成地理空间特征提升现有模型的效果。

  2. Mistral AI92

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。

    推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。

9月29日周二
  1. Microsoft Research66

    微软发布Quine生物研究系统,多模态模型辅助胰腺癌药物筛选

    微软发布Quine,一个面向生物学的多模态世界模型与交互式研究系统。该系统在胰腺导管腺癌研究中,通过预测并优先排序数千种化合物,成功引导湿实验验证了驱动肿瘤细胞状态转变的候选药物,将筛选过程缩短至数天。

    推荐理由:微软发布Quine生物研究系统,通过多模态世界模型辅助实验设计,在胰腺癌研究中验证了加速化合物筛选的可行性。

9月25日周五
  1. Google Research79

    Google 发布 AI 视频联合导演框架及四个长视频生成评测基准

    Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。

    推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。

  2. Google DeepMind77

    Gemini 3.8 Live 新增 Live Avatar 实时视觉形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。

    推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。

9月24日周四
  1. NVIDIA Blog66

    NVIDIA联合发布2800多种病毒蛋白复合物结构数据集

    NVIDIA联合Google DeepMind等机构,通过AlphaFold Database开源2800多种病毒蛋白复合物3D结构。该数据集利用NVIDIA BioNeMo Inference Runtime优化AlphaFold2生成,包含约30%全新相互作用结构,并同步开源BioNeMo Structure Prediction Pipeline供研究人员预测自身目标。

    推荐理由:NVIDIA联合多方开源2800多种病毒蛋白复结构,提供GPU加速预测工具,为未来疫情应对储备关键数据。

9月23日周三
9月21日周一
9月18日周五
  1. Google Research62

    Google 发布基于 GenUI 的教育模拟生成实验,开放 30 余个 STEM 示例

    Google Research 发布基于生成式 UI(GenUI)的教育模拟生成实验,允许教师动态创建定制化的互动学习模拟。该实验已发布包含物理、化学等学科的 30 余个 AI 生成示例,并开放 Google for Education Pilot Program 供学校申请试用。

    推荐理由:Google 发布基于 GenUI 的教育模拟生成实验,提供 30 余个 STEM 示例并开放教师试点,展示了生成式 UI 在定制教学中的落地路径。

9月16日周三
9月10日周四
9月4日周五
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球天气 AI 模型,支持每小时更新、最高 5 公里分辨率,并引入实时卫星数据。该模型在降水预测上取得突破,准确率较前代大幅提升,已集成至 Google Search、Gemini、Google Maps 等平台,并向开发者开放数据接口。

    推荐理由:引入实时卫星数据与小时级更新,显著提升降水预测精度并开放给开发者使用。

  2. Hugging Face Blog75

    H Company 发布原生多模态编码器 NeoMME

    H Company 发布 NeoMME,一种原生多模态多语言编码器,使用单一双向 Transformer 处理文本和图像。NeoMME-Retriever 微调版支持单次前向传播输出密集和晚期交互嵌入,在 ViDoRe v3 基准上表现优异,并通过分层 token 池化和非对称量化将存储需求降低 255 倍。

    推荐理由:原生多模态架构配合高效压缩技术,为视觉文档检索提供了兼顾速度与精度的开源方案。

9月2日周三
  1. Google Research70

    Google与NASA合作发布基于深度学习的全球甲烷排放卫星检测框架

    Google Research与NASA JPL合作在PNAS发表论文,提出MAPL-EMIT深度学习框架,利用Swin-S视觉Transformer和360万合成数据,实现了对EMIT卫星数据中甲烷羽流的高精度检测与源定位。该模型在专家标注数据上召回率达84%,并开源了全球羽流数据库、训练模型及推理库。

    推荐理由:论文提出结合物理模拟与视觉Transformer的深度学习框架,显著提升了卫星遥感甲烷排放检测的精度与灵敏度。

8月25日周二
  1. Mistral AI42

    Mistral 与 HUMAIN 宣布战略合作推进中东主权AI

    Mistral 与 HUMAIN 宣布战略合作,在沙特阿拉伯及中东地区推进主权AI。双方将联合开发针对阿拉伯语优化的前沿模型,重点聚焦网络安全与语音领域,并探索利用 HUMAIN 数据中心满足当地算力需求。该合作涉及数亿欧元,旨在通过本地基础设施与开放权重模型,帮助金融、制造等受监管行业实现数据与控制权自主。

8月22日周六
8月21日周五
  1. Google Research42

    Google Research 提出 ME-POIs 框架,通过融合移动数据增强语言模型对地点的理解

    Google Research 提出 ME-POIs 框架,将匿名移动模式与文本描述融合以增强语言模型对地点的理解。该框架通过自监督方法构建数值向量,使模型能捕捉地点的动态功能节奏。集成该框架后,模型在预测访问意图、价格水平分类和繁忙度估算上分别获得最高 81.9%、75.1% 和 24.7% 的相对提升。

8月17日周一
  1. Google Research70

    Google Research 提出 PhotoScan 利用智能手机图像估算体成分与代谢风险

    Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。

    推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。

8月13日周四
  1. Hugging Face Blog72

    OlmoEarth Studio 开放自定义嵌入向量导出功能

    OlmoEarth Studio 现支持计算并导出自定义嵌入向量,生成轻量级 Cloud-Optimized GeoTIFF (COG) 文件。用户可通过 Studio UI 或 API 选择感兴趣区域、时间范围、编码器变体(Nano/Tiny/Base)及影像源,获取用于相似度搜索、少样本分割、变化检测和 PCA 探索的嵌入数据。

    推荐理由:OlmoEarth Studio 开放自定义嵌入向量导出,提供轻量级 COG 格式及下游应用示例,便于直接复用。

  2. Microsoft Research42

    MindTopo 揭示多模态大模型的空间推理能力

    Microsoft Research 发布 MindTopo 基准测试,评估多模态大模型在拓扑推理与规划中的表现。测试涵盖连通性、包围等五类拓扑属性,结果显示当前模型在静态识别上表现尚可,但在交互规划中常因无法维持结构关系而失败。该基准旨在揭示 AI 在机器人等交互环境中理解拓扑结构的差距。

8月12日周三
  1. Google DeepMind85

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。

    推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。

  2. Google Research88

    Google 发布 AMIE 实时视频问诊研究:达到专家级临床诊断水平

    Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。

    推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。

8月10日周一
  1. Hugging Face Blog85

    Meta 发布 Muse Glimmer 30B 多模态模型

    Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。

    推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 系列气象预测模型

    Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。

    推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。

7月30日周四
  1. Google DeepMind83

    Gemini Robotics ER 2 发布,升级视频理解与多机协作

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机协作能力。模型通过 Gemini Live API 提供低延迟流式推理,支持进度分类与关键帧定位,开发者可通过 Gemini API 接入。

    推荐理由:模型升级视频理解与多机协作能力,提供 Gemini API 入口,开发者可据此评估物理智能体的任务编排潜力。

7月28日周二
  1. Google DeepMind85

    Google DeepMind 发布 Gemini Robotics 2 智能体模型

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA、ER 和端侧三大模型,赋予机器人全身控制、精细操作与多机协作能力。Gemini Robotics ER 2 已在 Google AI Studio 开放,VLA 模型面向早期合作伙伴。

    推荐理由:原文给出了三大模型的能力边界与开放入口,读者可据此评估其在复杂物理任务中的实际落地价值。

7月16日周四
  1. Hugging Face Blog40

    领域专精模型 DharmaOCR 在巴西葡萄牙语 OCR 任务中超越 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在巴西葡萄牙语 OCR 基准测试中得分 0.925,显著超越 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587)。该模型通过针对葡萄牙语语料库的监督微调与直接偏好优化(DPO),将全部参数集中于特定领域,从而在复杂文档处理中实现了更高的提取质量与稳定性。

  2. Google DeepMind43

    Google DeepMind 与 Isomorphic Labs 联合发布生物弹性方案

    Google DeepMind 与 Isomorphic Labs 联合发布生物弹性方案,旨在通过 AI 技术提升社会应对未来疫情及生物威胁的韧性。该方案涵盖预防、检测与响应三大领域,包括利用 Gemini 模型进行安全评估、通过 AlphaEvolve 优化病原体监测算法,以及开放 AlphaFold 等最新 AI 系统供受信任的研究者加速疫苗与药物设计。