MIT科技评论访谈:AI设计病毒蓝图的创造者
MIT Technology Review 将于 10 月 16 日举办圆桌访谈,由资深 AI 记者 James O’Donnell 采访斯坦福大学博士生 Samuel King。King 在 2025 年利用生成式 AI 模型提出了微观病毒的基因蓝图,该访谈将探讨这一工作及其对生物学的意义。
MIT Technology Review 将于 10 月 16 日举办圆桌访谈,由资深 AI 记者 James O’Donnell 采访斯坦福大学博士生 Samuel King。King 在 2025 年利用生成式 AI 模型提出了微观病毒的基因蓝图,该访谈将探讨这一工作及其对生物学的意义。
Zuckerberg支持的Biohub牵头18亿美元项目,旨在构建能预测细胞行为的AI模型以加速药物研发。Meta、Google DeepMind和Isomorphic Labs等贡献3亿美元,美国能源部投入超5亿美元。商业资助方可在数据公开前享有一年独占期,首个数据集预计一年后就绪。
OpenAI 向 ChatGPT 用户全面推送 GPT-6,引入“智能 UI”功能,将回答转化为包含图表、按钮和迷你应用的交互式界面。该模型支持在“思考”过程中同时输出内容,使等待时间缩短 44%,Plus 及以上用户今日即可使用。
推荐理由:GPT-6 引入交互式 UI 与流式思考功能,显著缩短响应时间,为 ChatGPT 交互形态带来实质性变化。
OpenAI 随 GPT-6 模型发布 ChatGPT 智能界面(Intelligent UI),将交互式图表、可点击按钮和定制计算器等视觉元素整合进对话中。该功能面向 Pro、Plus、Business 和 Enterprise 用户周三全球上线,周四扩展至免费及 Go 层级用户。
推荐理由:GPT-6 引入交互式图表和可操作组件,将改变 ChatGPT 从纯文本向多模态交互的演进方向。
OpenAI 在 ChatGPT 中推出智能界面功能,允许模型在回复中生成图表、表单和可点击按钮等交互元素。该功能随 GPT-6 模型向 Plus、Pro 等付费用户开放,并将于周四扩展至免费用户。
推荐理由:GPT-6 引入可交互图表与工具生成能力,为复杂任务提供了更直观的交互方式。
Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型,基于 Liquid Foundation Models 架构,通过单次前向传播输出结构化决策而非生成 Token。
推荐理由:Liquid AI 开源 d1-3B 与 d1-omni-600M 决策模型,在端侧设备实现毫秒级推理,为多模态结构化决策提供新方案。
OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。
推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。
OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。
推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。
OpenAI 发布 Jev-style Decisions API,支持 gpt-6-luna 模型进行图像和文本决策推理。该模型输入定价为每百万 token 10 美分,支持 yes/no、choices 和 scores 三种问题类型。llm-openai-decisions 0.1a0 插件已上线,可通过 llm install 命令安装使用。
Mistral 发布 Mistral Large 4 预览版,这是一个拥有 1 万亿参数、490 亿活跃参数的模型,通过 API 提供预览,并承诺月底开放权重。该模型支持“无”和“高”两种推理级别,在多模态图像生成上表现显著提升,在 Artificial Analysis 上得分 38,接近 DeepSeek 4.1 Flash。
Google DeepMind 发布 EmbeddingGemma 2,这是一个基于 Gemma 4 架构的 7.4 亿参数多模态嵌入模型,原生支持文本、代码、图像、音频和视频的统一嵌入空间。
推荐理由:7.4亿参数原生多模态模型,支持端侧运行与向量截断,适合隐私优先的本地检索场景。
Google Research 发布地球AI人口动态基础模型PDFM,将搜索趋势、环境等隐私数据压缩为位置嵌入。该模型在麻疹疫苗、心血管疾病、登革热、产后抑郁和霍乱预测中验证了提升效果,并作为Population Dynamics Insights在Google Maps Platform开放预览。
推荐理由:原文展示了PDFM在五大公共卫生场景的实测增益,读者可评估其作为现成地理空间特征提升现有模型的效果。
Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。
推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。
微软发布Quine,一个面向生物学的多模态世界模型与交互式研究系统。该系统在胰腺导管腺癌研究中,通过预测并优先排序数千种化合物,成功引导湿实验验证了驱动肿瘤细胞状态转变的候选药物,将筛选过程缩短至数天。
推荐理由:微软发布Quine生物研究系统,通过多模态世界模型辅助实验设计,在胰腺癌研究中验证了加速化合物筛选的可行性。
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。
推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。
NVIDIA联合Google DeepMind等机构,通过AlphaFold Database开源2800多种病毒蛋白复合物3D结构。该数据集利用NVIDIA BioNeMo Inference Runtime优化AlphaFold2生成,包含约30%全新相互作用结构,并同步开源BioNeMo Structure Prediction Pipeline供研究人员预测自身目标。
推荐理由:NVIDIA联合多方开源2800多种病毒蛋白复结构,提供GPU加速预测工具,为未来疫情应对储备关键数据。
NVIDIA 在新加坡 AI Day 展示其在东南亚的 AI 进展,推动公共部门 AI 从试点走向生产部署。NCS 利用 Nemotron 模型和 VSS Blueprint 推进企业级智能体 AI 应用。iApp Technology 基于 Nemotron 3 Nano 微调 OpenThai 2.0 Legal 构建法律助手 Thanoy,已服务约 43,000 名用户。
微软发布并开源分子合成预测模型 RetroChimera,该模型融合 R-SMILES 2 与 NeuralLoc 两种架构,通过集成学习策略在盲测中表现优于单一模型。
推荐理由:模型融合两种架构互补优势并开源,为化学合成路线规划提供了可复用的前沿工具。
Google Research 发布基于生成式 UI(GenUI)的教育模拟生成实验,允许教师动态创建定制化的互动学习模拟。该实验已发布包含物理、化学等学科的 30 余个 AI 生成示例,并开放 Google for Education Pilot Program 供学校申请试用。
推荐理由:Google 发布基于 GenUI 的教育模拟生成实验,提供 30 余个 STEM 示例并开放教师试点,展示了生成式 UI 在定制教学中的落地路径。
Mistral 与 Mozilla 达成合作,由 Mistral 模型驱动 Firefox Smart Window(beta)智能浏览助手。该功能在法国和北美上线,支持多语言及文化语境理解,默认不保存对话数据且合作伙伴零数据留存。
Hugging Face 官方博客发布 Workflow1111,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图。
推荐理由:Gradio 官方展示了 Workflow1111 项目,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图,支持多模型混合编排与 MCP 工具调用。
Google 联合 HHMI Janelia 发布迄今最大的雄性果蝇脑图谱,包含 166,000 个神经元和 1.25 亿个突触连接。该成果利用 AI 工具 PATHFINDER 完成三维重建,并通过 Neuroglancer 开源工具提供可视化与下载。这一完整连接组为研究神经回路机制及对比雌雄果蝇差异提供了基础资源。
Google DeepMind 发布 WeatherNext 3,这是其最先进的全球天气 AI 模型,支持每小时更新、最高 5 公里分辨率,并引入实时卫星数据。该模型在降水预测上取得突破,准确率较前代大幅提升,已集成至 Google Search、Gemini、Google Maps 等平台,并向开发者开放数据接口。
推荐理由:引入实时卫星数据与小时级更新,显著提升降水预测精度并开放给开发者使用。
H Company 发布 NeoMME,一种原生多模态多语言编码器,使用单一双向 Transformer 处理文本和图像。NeoMME-Retriever 微调版支持单次前向传播输出密集和晚期交互嵌入,在 ViDoRe v3 基准上表现优异,并通过分层 token 池化和非对称量化将存储需求降低 255 倍。
推荐理由:原生多模态架构配合高效压缩技术,为视觉文档检索提供了兼顾速度与精度的开源方案。
Google Research与NASA JPL合作在PNAS发表论文,提出MAPL-EMIT深度学习框架,利用Swin-S视觉Transformer和360万合成数据,实现了对EMIT卫星数据中甲烷羽流的高精度检测与源定位。该模型在专家标注数据上召回率达84%,并开源了全球羽流数据库、训练模型及推理库。
推荐理由:论文提出结合物理模拟与视觉Transformer的深度学习框架,显著提升了卫星遥感甲烷排放检测的精度与灵敏度。
Mistral 与 HUMAIN 宣布战略合作,在沙特阿拉伯及中东地区推进主权AI。双方将联合开发针对阿拉伯语优化的前沿模型,重点聚焦网络安全与语音领域,并探索利用 HUMAIN 数据中心满足当地算力需求。该合作涉及数亿欧元,旨在通过本地基础设施与开放权重模型,帮助金融、制造等受监管行业实现数据与控制权自主。
Google Research 发布 Biomarker Discovery Framework,这是一个多智能体系统,用于从可穿戴设备数据中优先筛选候选生物标志物。
推荐理由:原文展示了多智能体系统如何结合统计严谨性与人类监督,从可穿戴设备数据中自动化发现候选生物标志物。
Google Research 提出 ME-POIs 框架,将匿名移动模式与文本描述融合以增强语言模型对地点的理解。该框架通过自监督方法构建数值向量,使模型能捕捉地点的动态功能节奏。集成该框架后,模型在预测访问意图、价格水平分类和繁忙度估算上分别获得最高 81.9%、75.1% 和 24.7% 的相对提升。
Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。
推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。
OlmoEarth Studio 现支持计算并导出自定义嵌入向量,生成轻量级 Cloud-Optimized GeoTIFF (COG) 文件。用户可通过 Studio UI 或 API 选择感兴趣区域、时间范围、编码器变体(Nano/Tiny/Base)及影像源,获取用于相似度搜索、少样本分割、变化检测和 PCA 探索的嵌入数据。
推荐理由:OlmoEarth Studio 开放自定义嵌入向量导出,提供轻量级 COG 格式及下游应用示例,便于直接复用。
Microsoft Research 发布 MindTopo 基准测试,评估多模态大模型在拓扑推理与规划中的表现。测试涵盖连通性、包围等五类拓扑属性,结果显示当前模型在静态识别上表现尚可,但在交互规划中常因无法维持结构关系而失败。该基准旨在揭示 AI 在机器人等交互环境中理解拓扑结构的差距。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。
推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。
Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。
推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。
Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。
推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。
Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。
推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。
Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机协作能力。模型通过 Gemini Live API 提供低延迟流式推理,支持进度分类与关键帧定位,开发者可通过 Gemini API 接入。
推荐理由:模型升级视频理解与多机协作能力,提供 Gemini API 入口,开发者可据此评估物理智能体的任务编排潜力。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA、ER 和端侧三大模型,赋予机器人全身控制、精细操作与多机协作能力。Gemini Robotics ER 2 已在 Google AI Studio 开放,VLA 模型面向早期合作伙伴。
推荐理由:原文给出了三大模型的能力边界与开放入口,读者可据此评估其在复杂物理任务中的实际落地价值。
DharmaOCR 在巴西葡萄牙语 OCR 基准测试中得分 0.925,显著超越 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587)。该模型通过针对葡萄牙语语料库的监督微调与直接偏好优化(DPO),将全部参数集中于特定领域,从而在复杂文档处理中实现了更高的提取质量与稳定性。
Google DeepMind 与 Isomorphic Labs 联合发布生物弹性方案,旨在通过 AI 技术提升社会应对未来疫情及生物威胁的韧性。该方案涵盖预防、检测与响应三大领域,包括利用 Gemini 模型进行安全评估、通过 AlphaEvolve 优化病原体监测算法,以及开放 AlphaFold 等最新 AI 系统供受信任的研究者加速疫苗与药物设计。