ChatGPT 搭载 GPT-6 推出交互式 UI 功能
OpenAI 向 ChatGPT 用户全面推送 GPT-6,引入“智能 UI”功能,将回答转化为包含图表、按钮和迷你应用的交互式界面。该模型支持在“思考”过程中同时输出内容,使等待时间缩短 44%,Plus 及以上用户今日即可使用。
推荐理由:GPT-6 引入交互式 UI 与流式思考功能,显著缩短响应时间,为 ChatGPT 交互形态带来实质性变化。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
OpenAI 向 ChatGPT 用户全面推送 GPT-6,引入“智能 UI”功能,将回答转化为包含图表、按钮和迷你应用的交互式界面。该模型支持在“思考”过程中同时输出内容,使等待时间缩短 44%,Plus 及以上用户今日即可使用。
推荐理由:GPT-6 引入交互式 UI 与流式思考功能,显著缩短响应时间,为 ChatGPT 交互形态带来实质性变化。
OpenAI 随 GPT-6 模型发布 ChatGPT 智能界面(Intelligent UI),将交互式图表、可点击按钮和定制计算器等视觉元素整合进对话中。该功能面向 Pro、Plus、Business 和 Enterprise 用户周三全球上线,周四扩展至免费及 Go 层级用户。
推荐理由:GPT-6 引入交互式图表和可操作组件,将改变 ChatGPT 从纯文本向多模态交互的演进方向。
OpenAI 在 ChatGPT 中推出智能界面功能,允许模型在回复中生成图表、表单和可点击按钮等交互元素。该功能随 GPT-6 模型向 Plus、Pro 等付费用户开放,并将于周四扩展至免费用户。
推荐理由:GPT-6 引入可交互图表与工具生成能力,为复杂任务提供了更直观的交互方式。
Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型,基于 Liquid Foundation Models 架构,通过单次前向传播输出结构化决策而非生成 Token。
推荐理由:Liquid AI 开源 d1-3B 与 d1-omni-600M 决策模型,在端侧设备实现毫秒级推理,为多模态结构化决策提供新方案。
OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。
推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。
OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。
推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。
Google DeepMind 发布 EmbeddingGemma 2,这是一个基于 Gemma 4 架构的 7.4 亿参数多模态嵌入模型,原生支持文本、代码、图像、音频和视频的统一嵌入空间。
推荐理由:7.4亿参数原生多模态模型,支持端侧运行与向量截断,适合隐私优先的本地检索场景。
Google Research 发布地球AI人口动态基础模型PDFM,将搜索趋势、环境等隐私数据压缩为位置嵌入。该模型在麻疹疫苗、心血管疾病、登革热、产后抑郁和霍乱预测中验证了提升效果,并作为Population Dynamics Insights在Google Maps Platform开放预览。
推荐理由:原文展示了PDFM在五大公共卫生场景的实测增益,读者可评估其作为现成地理空间特征提升现有模型的效果。
Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。
推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。
微软发布Quine,一个面向生物学的多模态世界模型与交互式研究系统。该系统在胰腺导管腺癌研究中,通过预测并优先排序数千种化合物,成功引导湿实验验证了驱动肿瘤细胞状态转变的候选药物,将筛选过程缩短至数天。
推荐理由:微软发布Quine生物研究系统,通过多模态世界模型辅助实验设计,在胰腺癌研究中验证了加速化合物筛选的可行性。
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。
推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。
NVIDIA联合Google DeepMind等机构,通过AlphaFold Database开源2800多种病毒蛋白复合物3D结构。该数据集利用NVIDIA BioNeMo Inference Runtime优化AlphaFold2生成,包含约30%全新相互作用结构,并同步开源BioNeMo Structure Prediction Pipeline供研究人员预测自身目标。
推荐理由:NVIDIA联合多方开源2800多种病毒蛋白复结构,提供GPU加速预测工具,为未来疫情应对储备关键数据。
微软发布并开源分子合成预测模型 RetroChimera,该模型融合 R-SMILES 2 与 NeuralLoc 两种架构,通过集成学习策略在盲测中表现优于单一模型。
推荐理由:模型融合两种架构互补优势并开源,为化学合成路线规划提供了可复用的前沿工具。
Google Research 发布基于生成式 UI(GenUI)的教育模拟生成实验,允许教师动态创建定制化的互动学习模拟。该实验已发布包含物理、化学等学科的 30 余个 AI 生成示例,并开放 Google for Education Pilot Program 供学校申请试用。
推荐理由:Google 发布基于 GenUI 的教育模拟生成实验,提供 30 余个 STEM 示例并开放教师试点,展示了生成式 UI 在定制教学中的落地路径。
Hugging Face 官方博客发布 Workflow1111,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图。
推荐理由:Gradio 官方展示了 Workflow1111 项目,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图,支持多模型混合编排与 MCP 工具调用。
H Company 发布 NeoMME,一种原生多模态多语言编码器,使用单一双向 Transformer 处理文本和图像。NeoMME-Retriever 微调版支持单次前向传播输出密集和晚期交互嵌入,在 ViDoRe v3 基准上表现优异,并通过分层 token 池化和非对称量化将存储需求降低 255 倍。
推荐理由:原生多模态架构配合高效压缩技术,为视觉文档检索提供了兼顾速度与精度的开源方案。
OlmoEarth Studio 现支持计算并导出自定义嵌入向量,生成轻量级 Cloud-Optimized GeoTIFF (COG) 文件。用户可通过 Studio UI 或 API 选择感兴趣区域、时间范围、编码器变体(Nano/Tiny/Base)及影像源,获取用于相似度搜索、少样本分割、变化检测和 PCA 探索的嵌入数据。
推荐理由:OlmoEarth Studio 开放自定义嵌入向量导出,提供轻量级 COG 格式及下游应用示例,便于直接复用。
Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。
推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。
Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。
推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。