跳到正文

#端侧

今日 0 条
10月8日周四
10月7日周三
8月21日周五
  1. Hugging Face Blog75

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.2 倍

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,为 LFM2.5 系列模型提供推测解码路径,在 H100 上最高实现 3.18 倍吞吐提升,在 M4 Max 上最高实现 2.87 倍提升。该方案已开源并支持 llama.cpp 和 SGLang,在保持输出质量不变的前提下显著降低延迟。

    推荐理由:原文给出了具体加速数据与部署配置,读者可据此评估端侧交互体验提升与现有工作流的适配度。

6月27日周六
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

6月2日周二
4月13日周一
  1. Google DeepMind76

    Gemini Robotics-ER 1.6 发布,增强具身推理与仪表读取能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,显著增强空间推理、多视角理解及仪表读取能力。该模型支持通过 Gemini API 和 Google AI Studio 调用,具备通过代码执行与视觉推理实现高精度仪表读数,并提升了物理安全约束遵循能力。

    推荐理由:新增仪表读取与多视角推理能力,为具身智能体提供可验证的物理世界交互方案。

1月20日周二
  1. Hugging Face Blog88

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。

    推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。

10月28日周二
  1. Hugging Face Blog72

    IBM 发布 Granite 4.0 Nano 系列端侧模型

    IBM 发布 Granite 4.0 Nano 系列模型,包含 350M 和 1B 参数版本,采用混合 SSM 架构或传统 Transformer 架构,面向端侧和 On-device 应用。模型基于 15T tokens 数据训练,支持 vLLM、llama.cpp 和 MLX 等运行环境,并在 IFEval 和 BFCLv3 等基准测试中表现优异。

    推荐理由:IBM 发布 3.5 亿至 15 亿参数模型,提供混合架构与传统 Transformer 两种选择,适合端侧部署。