Google联合Included Health启动全美医疗AI真实世界随机对照试验
Google宣布与Included Health合作,在获得IRB批准后启动全美随机对照试验,评估对话式AI在真实虚拟护理工作流中的表现。该研究基于AMIE、PHA等前期基础,旨在通过大规模真实患者数据验证AI的安全性与有效性。
推荐理由:Google联合Included Health启动全美随机对照试验,标志着医疗AI从实验室模拟走向真实世界的大规模临床验证。
Google宣布与Included Health合作,在获得IRB批准后启动全美随机对照试验,评估对话式AI在真实虚拟护理工作流中的表现。该研究基于AMIE、PHA等前期基础,旨在通过大规模真实患者数据验证AI的安全性与有效性。
推荐理由:Google联合Included Health启动全美随机对照试验,标志着医疗AI从实验室模拟走向真实世界的大规模临床验证。
Google Research 发布 ATLAS 多语言模型缩放法则,基于 774 次训练实验量化 1400 对语言间的协同与干扰效应,为多语言模型规模、数据量及语言配比提供数据驱动指导。
Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。
推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。
Google DeepMind 发布 D4RT,一种统一的 AI 模型,用于跨时空的动态 4D 场景重建与追踪。该模型基于 Transformer 架构和灵活的查询机制,在单块 TPU 上处理一分钟视频仅需约五秒,比此前最先进方法快 18 至 300 倍,可高效完成点追踪、点云重建和相机位姿估计,为机器人导航、增强现实及世界模型构建提供实时空间感知能力。
推荐理由:提出统一4D重建模型,速度提升最高300倍,为机器人和AR提供实时空间感知能力。
Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。
推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。
Google Research在《Science Advances》发表研究,介绍NeuralGCM利用2001至2018年NASA卫星降水观测数据训练,以改进对降水及其极值的模拟。在2020年15天预报测试中,NeuralGCM在陆地上的平均降水表现优于ECMWF模型;在多年模拟中,其平均误差较IPCC主流工具降低40%,并更准确地捕捉了极端降水和日降水周期。该模型代码已开源。
推荐理由:NeuralGCM利用卫星数据训练,在中期预报和长期模拟中显著降低降水误差,为气候研究提供了更可靠的工具。
TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。
推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。
Google Research 2025 年在基础 AI、量子计算及科学发现领域取得多项突破。Gemini 3 成为最准确的大语言模型,在 SimpleQA Verified 等基准测试中表现优异,并引入生成式 UI 功能。Gemma 模型支持 140 多种语言,Willow 芯片通过 Quantum Echoes 算法实现量子优势,加速了科学发现进程。
Google 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级低延迟、低成本结合。该模型在 GPQA Diamond 等基准上表现优异,SWE-bench Verified 得分 78%,超越 Gemini 3 Pro 且速度提升 3 倍。已面向开发者开放 API,并在 Gemini App 和 Search AI Mode 中默认启用。
推荐理由:在保持 Flash 级低延迟与低成本的同时,推理与编码能力超越前代旗舰,适合高频开发及智能体工作流。
Google 联合非洲数据科学社区举办 Data Science for Health Ideathon,利用 MedGemma、TxGemma 和 MedSigLIP 等开源健康 AI 模型解决当地医疗挑战。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。
Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。
推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。
AlphaFold 2 五年前解决了蛋白质结构预测难题,其预测数据已收录于 AlphaFold Protein Database 并免费开放。该数据库已被全球 300 多万研究人员使用,相关研究被引用超 3.5 万次,并助力 2024 年诺贝尔化学奖的获得。
Google DeepMind的AlphaFold结合密苏里大学的冷冻电镜技术,成功解析了低密度脂蛋白(LDL)的关键蛋白apoB100的原子级结构。该发现揭示了包裹LDL颗粒的笼状外壳细节,有望为预防和治疗动脉粥样硬化性心血管疾病提供新的药物靶点。
推荐理由:AlphaFold结合冷冻电镜解析了致病蛋白apoB100结构,为心血管药物研发提供了关键结构基础。
Google 发布端到端实时语音翻译模型,延迟仅2秒并保留原声,已在 Google Meet 和 Pixel 10 部署。该模型基于 AudioLM 和 SpectroStream 架构,支持英、西、德、法、意、葡等语言。
推荐理由:端到端架构将延迟降至2秒并保留原声,已在Google Meet和Pixel 10部署,可据此评估实时语音翻译的技术进展。
Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。
推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。
Google DeepMind 在新加坡设立新研究实验室,加速前沿 AI 在亚太地区的研发与应用。新团队将聚焦 Gemini 核心能力提升及语言文化包容性研究,并与政府、企业及学术界深化合作。此举旨在通过 AlphaFold、SEA-LION 等成果,推动 AI 技术更好地服务亚太地区多样化需求。
Google DeepMind 发布 WeatherNext 2,生成速度提升 8 倍,分辨率达小时级,可预测数百种天气场景。该模型基于 Functional Generative Network 架构,在 99.9% 的变量上超越前代,数据已上线 Earth Engine 和 BigQuery,并升级了 Google Search、Gemini 及 Maps 的天气服务。
推荐理由:模型速度提升8倍且支持小时级分辨率,通过多场景预测增强极端天气研判能力。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。
推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。
北爱尔兰 C2k 项目的 100 名教师通过整合 Gemini 和 Google Workspace 工具,每周平均节省 10 小时工作时间。试点项目捕获了 600 多个 Gemini 独特用例,涵盖行政工作简化、爱尔兰语课程创建及个性化学习支持。C2k 计划将 Gemini 培训推广至更多教师,以深化 AI 在教育中的负责任应用。
Google Research 发布 Google Earth AI、DeepSomatic 与 Quantum Echoes 三大突破,加速科研与应用的循环。
Hugging Face 发布指南,对比了 Nanonets-OCR2、OlmOCR-2、Granite-Docling 等开源OCR模型的能力与成本,介绍了 OlmOCR-Bench 等评测基准,并提供了基于 vLLM 和 Transformers 的本地部署与批量推理代码。
推荐理由:系统梳理了多款开源OCR模型的能力差异与评测基准,并提供了本地部署与批量推理的实操代码。
Hugging Face 发布 mmBERT,基于 ModernBERT 架构训练的多语言编码器模型,覆盖 1800 多种语言,在 XTREME 和 MTEB 基准上显著超越 XLM-R 等前代模型。该模型采用三阶段渐进式语言学习策略,在 3T+ tokens 数据上训练,推理速度提升 2-4 倍,并开源了模型权重、训练数据及微调代码。
推荐理由:开源了覆盖1800种语言的现代BERT架构模型,提供了显著的性能与速度提升及微调代码。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含 524 万条由 Boltz1 生成的 AI 共折叠蛋白-配体 3D 结构及实验验证的 IC50 数据。该数据集采用 CC BY 4.0 许可,97% 的结构通过了 PoseBusters 验证,旨在解决 AI 药物研发中高质量结构数据的长期短缺问题。
推荐理由:SAIR 开源了 524 万条高精度蛋白-配体 3D 结构及 IC50 数据,为 AI 药物发现提供了稀缺的高质量训练集。
Hugging Face 发布 FilBench,系统评估 LLM 在 Tagalog、Filipino 和 Cebuano 等菲律宾语言上的表现。评测涵盖文化、NLP、阅读理解和生成四大类,结果显示 GPT-4o 表现最佳,而 SEA-LION 等区域模型在参数效率上具有优势。开源模型在成本效益上优于商业模型,但翻译任务仍是主要难点。
Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。
推荐理由:TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。
Mistral 展示通过 LoRA 微调 Pixtral-12B 在卫星图像分类任务上的显著性能提升。基线模型在区分“游乐场”与“体育场”等细微视觉差异时存在幻觉,微调后模型能更准确地识别密集住宅、稀疏住宅等复杂场景。该过程利用 Mistral 微调 API 或 LaPlateforme UI 即可高效完成,无需 extensive 超参数调整。
Arc Institute发布虚拟细胞挑战赛,要求训练模型预测基因沉默对细胞的影响。Hugging Face博客详细解析了挑战赛的背景、数据集结构以及Arc提出的STATE基线模型,包括State Transition Model和State Embedding Model的架构设计。
Mistral 发布 Mistral OCR API,支持图像和 PDF 输入,可高精度提取文本、表格、公式及嵌入图片,并输出有序交错的 Markdown 或结构化 JSON。该模型在多项基准测试中超越竞品,支持多语言处理,API 定价为每 1000 页 1 美元,已在 Le Chat 中作为默认文档理解模型使用。
推荐理由:Mistral 发布专用 OCR API 并公布基准数据与定价,为 RAG 场景提供结构化文档解析方案。
Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚语言(如阿拉伯语、泰米尔语)进行了优化。该模型在区域语言任务上表现优于大 5 倍的通用模型,支持 API 调用及单 GPU 本地部署,速度超过 150 tokens/秒。
推荐理由:原文给出了24B参数模型在阿拉伯语等区域语言上的性能优势及本地部署能力,读者可据此评估区域化定制方案。
Hugging Face 联合 2A2I 和 TII 发布 Open Arabic LLM Leaderboard 2。首版 OALL 上线不到 7 个月吸引超 46,000 访客,收录超 700 个模型。新版旨在解决资源限制与结果验证问题,提供更统一、透明的基准测试平台。
Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。
推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。
Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。
推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。
Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。
推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。
Mistral AI 发布 Mistral Large 2 模型,拥有 123B 参数与 128k 上下文窗口,支持单节点高效推理。该模型在代码生成与数学推理上对标 GPT-4o 与 Claude 3 Opus,并强化了工具调用与多语言指令遵循能力。
推荐理由:模型在推理与代码能力上对标前沿闭源模型,且支持单节点部署,为开发者提供了高性价比的替代方案。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。