Google Research 提出 Diffusion Controller 统一图像生成控制框架
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级“转向阻尼器”网络动态调整生成轨迹。该框架在灰盒和全白盒环境下均优于 LoRA,实现了更优的质量与效率平衡。
推荐理由:提出统一控制框架解决图像生成引导难题,在受限访问下优于LoRA。
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级“转向阻尼器”网络动态调整生成轨迹。该框架在灰盒和全白盒环境下均优于 LoRA,实现了更优的质量与效率平衡。
推荐理由:提出统一控制框架解决图像生成引导难题,在受限访问下优于LoRA。
微软发布 Physical AI Toolchain,新增支持将物理 AI 推理卸载至边缘或云 GPU 的能力。实测表明,该方案可提升任务成功率,使电池续航延长数小时,并提供基于 Kubernetes 的自动容器化部署工具。
推荐理由:微软发布支持推理卸载的工具链,实测显示可显著提升机器人性能并延长续航。
Google Research 在 ICML 2026 发表论文提出 Retrieve-for-Train 框架,利用离线强化学习发现奖励对齐的查询扩展策略,并将其蒸馏至 53.9M 参数的扩散检索器中。该框架通过单次非自回归并行推理生成完整查询集,在保持多样性和对齐性的同时,相比自回归方法实现 12 至 20 倍的速度提升。
推荐理由:提出通过离线强化学习将复杂搜索策略蒸馏至轻量扩散模型,实现单次推理并大幅提升检索速度。
IBM 在 ALTK-Evolve 中引入一致性指导原则,通过一致性分析器定位决策点并生成指导原则,在不损失平均准确率的前提下显著缩小智能体表现波动。
推荐理由:提出通过一致性分析器定位决策点并生成指导原则,在不损失平均准确率的前提下显著缩小智能体表现波动。
Multiverse Computing 提出量化感知愈合(QAH)方法,将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项上超越其全精度版本。该方法通过从原始模型蒸馏而非恢复后的检查点,解决了结构压缩后的能力下降问题。
推荐理由:提出量化感知愈合方法,使压缩量化后的模型在多项基准上超越全精度版本。
METR 研究显示 AI 在网络安全领域加速显著,数学研究进展较小,AI 自身算法优化未见明显加速。SPADE 框架通过自博弈自动化生成可执行环境,Qwen3-30B-A3B-Instruct-2507 在基准测试中表现最佳。
Multiverse Computing 发布论文与开源代码,提出离线 Top-K Logits 缓存与融合分块 KL 损失,将知识蒸馏显存峰值降低15.6倍,使32K上下文蒸馏可在单张 H200 上运行。
推荐理由:通过离线缓存和分块计算将知识蒸馏显存需求降低15倍,使长上下文蒸馏可在单卡运行。
IBM Research基于K-Search框架开发结构化CUDA-to-MLX翻译层,将CUDA内核优化知识自动迁移至Apple Silicon。在Attention内核上达到原生MLX 0.97倍性能,在Mamba SSM内核上预填充速度较社区实现提升20倍。
推荐理由:提出跨平台内核优化思路,将CUDA经验自动迁移至Apple Silicon,在Mamba SSM上实现20倍预填充加速。
Google Research 在《Nature Cities》发表研究,通过十城六个月的实验证明,导航平台将少量行程引导至替代路线,可使目标路段车速中位数提升约 2%,并带来数千吨的年度 CO2 减排。
推荐理由:基于十城实测数据验证了导航平台协同调度对缓解拥堵和减排的系统性增益。
Google Research 提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题以最小化总拥有成本。在 Spanner 生产环境中,该方案使内存使用量减少 15.5%,缓存未命中率仅增加 5.5%,总拥有成本降低约 5%。
Hugging Face转载Dharma AI论文,展示在SFT后引入DPO阶段,利用模型自身的退化输出作为拒绝样本,在五个视觉语言模型家族中平均降低59.4%的文本退化率。
推荐理由:文章验证了DPO在结构化OCR任务中抑制文本退化,为无标注场景下的模型优化提供了可迁移的方法。
Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。
推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,通过解耦计算岛实现跨广域网的低带宽、高弹性训练。在 Gemma 4 模型测试中,该系统在硬件故障下保持高可用性与同等基准性能,并在 120 亿参数模型训练中实现比传统方法快 20 倍的速度。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,通过轨迹提升、状态迭代随机化及梯度重塑解决长视界规划难题。该方法将轨迹映射至虚拟状态实现时间并行优化,避免高维视觉模型中的脆弱梯度,使长视界规划更具鲁棒性。
Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。
推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。
Google Research 在 SPAA 2025 发表研究,针对时变容量环境下的非抢占式作业调度问题,提出最大化吞吐量的常数因子近似算法。离线场景中,Greedy 策略在单位利润下实现 1/2-近似,不同利润下实现 1/4-近似。在线场景中,允许重启的 Greedy 变体保持 1/2-竞争比,而禁止重启的严格模型下算法性能受限。
Google Research 提出 Sequential Attention,通过注意力机制的贪心选择机制解决子集选择难题,使模型更轻量且快速。该方法将选择过程融入单次训练,无需昂贵重训即可实现高效特征选择,并在多个神经网络基准测试中取得最先进结果。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Google Research 发布基于线性回归的轻量级 AI 模型,预测特定充电桩在指定时间后的可用性概率。该模型通过每小时特征权重量化占用率变化,在 30 至 60 分钟预测窗口内,相比“保持当前状态”基线显著提升了准确率。
Google 发布 Project Suncatcher 研究,提出由搭载 Google TPUs 的太阳能卫星组成的星座,通过自由空间光链路连接以构建可扩展的太空 AI 基础设施。早期实验验证了单对收发器可实现 800 Gbps 传输,Trillium v6e Cloud TPU 在辐射测试中表现稳健,预计 2030 年代中期发射成本将降至 200 美元/kg 以下。
Hugging Face基于Open LLM Leaderboard评估的3000多个模型,量化了模型推理阶段的CO₂排放。研究发现,社区微调模型通常比官方基座模型更具碳效率,这主要归因于微调减少了输出冗余和重复模式,从而降低了推理时的计算开销。