Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧多模态决策模型
Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型,基于 Liquid Foundation Models 架构,通过单次前向传播输出结构化决策而非生成 Token。
推荐理由:Liquid AI 开源 d1-3B 与 d1-omni-600M 决策模型,在端侧设备实现毫秒级推理,为多模态结构化决策提供新方案。
Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型,基于 Liquid Foundation Models 架构,通过单次前向传播输出结构化决策而非生成 Token。
推荐理由:Liquid AI 开源 d1-3B 与 d1-omni-600M 决策模型,在端侧设备实现毫秒级推理,为多模态结构化决策提供新方案。
Google DeepMind 发布 EmbeddingGemma 2,这是一个基于 Gemma 4 架构的 7.4 亿参数多模态嵌入模型,原生支持文本、代码、图像、音频和视频的统一嵌入空间。
推荐理由:7.4亿参数原生多模态模型,支持端侧运行与向量截断,适合隐私优先的本地检索场景。
Liquid AI 发布 LFM2.5-DSpark 草稿模型,为 LFM2.5 系列模型提供推测解码路径,在 H100 上最高实现 3.18 倍吞吐提升,在 M4 Max 上最高实现 2.87 倍提升。该方案已开源并支持 llama.cpp 和 SGLang,在保持输出质量不变的前提下显著降低延迟。
推荐理由:原文给出了具体加速数据与部署配置,读者可据此评估端侧交互体验提升与现有工作流的适配度。
Google Research 宣布在 Pixel 9 和 10 系列设备上部署针对 Gemini Nano v3 模型的 Multi-Token Prediction (MTP) 加速技术。
推荐理由:文章详述了通过冻结主干模型并附加MTP头实现端侧推理加速的技术路径,为移动端部署提供了可迁移的优化方案。
Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。
推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。
Holo3.1 发布,新增移动端自动化能力并支持函数调用协议,同时推出 0.8B 至 35B-A3B 四种尺寸及 FP8、NVFP4、Q4 GGUF 量化版本,支持在消费级硬件上实现本地化部署。
推荐理由:Holo3.1 扩展了移动端支持并推出端侧量化权重,为本地化部署提供了可迁移的参考。
Google DeepMind 发布 Gemini Robotics-ER 1.6,显著增强空间推理、多视角理解及仪表读取能力。该模型支持通过 Gemini API 和 Google AI Studio 调用,具备通过代码执行与视觉推理实现高精度仪表读数,并提升了物理安全约束遵循能力。
推荐理由:新增仪表读取与多视角推理能力,为具身智能体提供可验证的物理世界交互方案。
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。
IBM 发布 Granite 4.0 Nano 系列模型,包含 350M 和 1B 参数版本,采用混合 SSM 架构或传统 Transformer 架构,面向端侧和 On-device 应用。模型基于 15T tokens 数据训练,支持 vLLM、llama.cpp 和 MLX 等运行环境,并在 IFEval 和 BFCLv3 等基准测试中表现优异。
推荐理由:IBM 发布 3.5 亿至 15 亿参数模型,提供混合架构与传统 Transformer 两种选择,适合端侧部署。