跳到正文

#端侧

今日 0 条
10月8日周四
10月7日周三
9月24日周四
9月22日周二
  1. Hugging Face Blog78

    Hugging Face transformers 正式支持 GGUF 格式

    Hugging Face 宣布 transformers 正式支持 GGUF 格式,开发者可通过标准 API 在本地高效运行量化模型。该更新通过复用底层 ggml Metal 内核,显著提升了 Apple Silicon 设备上的推理性能,并支持通过 transformers serve 提供 OpenAI 兼容接口。

    推荐理由:Hugging Face 官方宣布 transformers 支持 GGUF 格式,通过复用底层 Metal 内核实现端侧高效推理。

8月21日周五
  1. Hugging Face Blog75

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.2 倍

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,为 LFM2.5 系列模型提供推测解码路径,在 H100 上最高实现 3.18 倍吞吐提升,在 M4 Max 上最高实现 2.87 倍提升。该方案已开源并支持 llama.cpp 和 SGLang,在保持输出质量不变的前提下显著降低延迟。

    推荐理由:原文给出了具体加速数据与部署配置,读者可据此评估端侧交互体验提升与现有工作流的适配度。

8月17日周一
  1. Google Research70

    Google Research 提出 PhotoScan 利用智能手机图像估算体成分与代谢风险

    Google Research 发布 PhotoScan 框架,通过智能手机图像估算体脂百分比、躯干臀部脂肪比及内脏皮下脂肪比,预测胰岛素抵抗的精度接近 DXA 扫描。该模型在 UK Biobank 预训练并在 PhotoBIA 队列微调,独立验证显示其预测胰岛素抵抗的 AUROC 达 0.760,优于传统 BMI 和 BIA 传感器。

    推荐理由:提出利用智能手机图像估算体脂分布并预测胰岛素抵抗,精度接近DXA,为代谢风险筛查提供新路径。

8月11日周二
  1. Hugging Face Blog78

    NVIDIA Magpie TTS 开源多语言语音模型,新增阿拉伯语等三种语言

    NVIDIA 在 Hugging Face 开源 Magpie 多语言 TTS 模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,支持12种语言。该模型提供364M参数开源权重及NIM部署方案,在B200上单流首音频延迟低至32ms,并引入帧堆叠与局部Transformer架构优化推理速度。

    推荐理由:提供开源权重与NIM部署方案,支持12种语言及低延迟指标,适合需要私有化部署和定制语音的开发者。

7月29日周三
  1. Berkeley AI Research75

    K-Search:将CUDA内核优化经验自动迁移至Apple Silicon

    IBM Research基于K-Search框架开发结构化CUDA-to-MLX翻译层,将CUDA内核优化知识自动迁移至Apple Silicon。在Attention内核上达到原生MLX 0.97倍性能,在Mamba SSM内核上预填充速度较社区实现提升20倍。

    推荐理由:提出跨平台内核优化思路,将CUDA经验自动迁移至Apple Silicon,在Mamba SSM上实现20倍预填充加速。

6月27日周六
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemma 4 12B 多模态模型

    Google DeepMind 发布 Gemma 4 12B 模型,采用无编码器架构,视觉和音频输入直接接入 LLM 主干,原生支持音频输入。该模型在 16GB 显存下即可运行,具备接近 26B 模型的推理性能,并内置多令牌预测(MTP)草稿器以降低延迟。

    推荐理由:采用无编码器架构并原生支持音频,在16GB显存下即可运行,适合本地部署智能体应用。

6月5日周五
  1. Google Research68

    Google Research 发布基于手机摄像头的被动心率监测研究

    Google Research 在《Nature》发表研究,介绍 PHRM 系统,利用手机前置摄像头在解锁后捕捉面部视频,通过深度学习被动估算心率。该系统在真实生活场景中实现全肤色心率测量误差低于 10%,静息心率估算误差低于 5 bpm,达到可穿戴设备水平,并开源了相关数据集和模型。

    推荐理由:研究提出基于手机前置摄像头的被动心率监测方案,在真实场景下实现全肤色高精度测量,为无感健康监测提供新路径。

6月3日周三
  1. Hugging Face Blog60

    Reachy Mini 支持通过 MCP 协议调用 Hugging Face Spaces 远程工具

    Hugging Face 宣布 Reachy Mini 对话应用新增 MCP 工具支持,允许通过 Hugging Face Spaces 远程调用天气查询、网络搜索等无状态能力。该功能通过 `reachy-mini-conversation-app tool-spaces add` 命令安装,工具逻辑在 Space 中运行,本地仅保留受信任的核心控制与硬件交互工具。

    推荐理由:Reachy Mini 引入 MCP 协议支持,允许通过 Hugging Face Spaces 远程调用工具,实现了应用本体与外部能力的解耦。

6月2日周二
5月28日周四
5月27日周三
  1. Hugging Face Blog77

    Hugging Face 教程:让 Reachy Mini 机器人实现全本地语音交互

    Hugging Face 发布教程,指导用户将 Reachy Mini 机器人的语音交互栈完全部署在本地。通过 speech-to-speech 库串联 Silero VAD、Parakeet-TDT 0.6B v3、Qwen3-TTS 等开源组件,并结合 llama.cpp 或 vLLM 运行 Gemma-4 或 Qwen3-4B 等模型,实现无需云端 API 的隐私保护与低延迟对话。

    推荐理由:提供将语音交互栈完全本地化的实操指南,展示如何在端侧实现隐私保护与低延迟的机器人对话。

4月13日周一
  1. Google DeepMind76

    Gemini Robotics-ER 1.6 发布,增强具身推理与仪表读取能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,显著增强空间推理、多视角理解及仪表读取能力。该模型支持通过 Gemini API 和 Google AI Studio 调用,具备通过代码执行与视觉推理实现高精度仪表读数,并提升了物理安全约束遵循能力。

    推荐理由:新增仪表读取与多视角推理能力,为具身智能体提供可验证的物理世界交互方案。

3月12日周四
  1. Google Research70

    Google Flood Hub 上线 AI 驱动的城市内涝预测功能

    Google Research 宣布在 Flood Hub 上线城市内涝(Flash Flood)预测功能,利用 AI 方法将预警时间提前至 24 小时。该模型通过 Gemini 分析公开新闻报道构建 Groundsource 数据集,结合全球气象数据预测人口密集区的内涝风险,在部分南方国家的表现与美国国家气象局相当。

    推荐理由:利用Gemini提取新闻数据构建训练集,在缺乏地面观测的南方国家实现24小时城市内涝预测。

2月18日周三
  1. Google Research68

    Google发布MapTrace合成数据管线,提升多模态大模型地图路径追踪能力

    Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。

    推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。

1月23日周五
  1. Google Research60

    Google 提出通过分解实现小模型优越意图提取

    Google 在 EMNLP 2025 发表论文,提出将用户意图理解分解为屏幕摘要和序列提取两阶段方法。该方法使小多模态模型在端侧实现与大模型相当的意图提取效果,兼顾隐私与效率。

    推荐理由:提出屏幕分解与意图提取两阶段方法,使小模型在端侧意图理解上媲美大模型,兼顾隐私与效率。

1月20日周二
  1. Hugging Face Blog88

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。

    推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。

1月16日周五
  1. Google Research50

    Google Research 利用 Pixel Watch 和深度学习模型估算高级步态指标

    Google Research 发布研究证明消费级智能手表可准确估算步速、步长等时空步态指标。该研究基于 246 名参与者的约 70,000 个步行片段,使用搭载时间卷积网络(TCN)的深度学习模型处理 Pixel Watch 的 IMU 数据。结果显示智能手表估算结果与智能手机方法性能相当,多数指标效度(Pearson r >0.80)和信度(ICC >0.80)良好。

11月20日周四
  1. Hugging Face Blog74

    AnyLanguageModel 发布统一 Apple 平台本地与云端 LLM 调用 API

    Hugging Face 发布 AnyLanguageModel,提供 Swift 包统一调用 Apple Foundation Models、Core ML、MLX、llama.cpp、Ollama 及 OpenAI 等模型。开发者只需替换 import 即可切换后端,支持按需引入依赖并扩展图像输入。

    推荐理由:统一了本地与云端模型调用接口,降低 Apple 平台开发者的集成成本。

10月29日周三
  1. Hugging Face Blog68

    NVIDIA Isaac for Healthcare v0.4 发布医疗机器人仿真到部署教程

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的医疗机器人端到端工作流。通过结合 93% 仿真数据与真实遥操作数据微调 GR00T N1.5 模型,实现从数据采集、训练到硬件部署的 Sim2Real 闭环。

    推荐理由:提供了从仿真到部署的完整代码与硬件配置,可直接复现医疗机器人工作流。

10月28日周二
  1. Hugging Face Blog72

    IBM 发布 Granite 4.0 Nano 系列端侧模型

    IBM 发布 Granite 4.0 Nano 系列模型,包含 350M 和 1B 参数版本,采用混合 SSM 架构或传统 Transformer 架构,面向端侧和 On-device 应用。模型基于 15T tokens 数据训练,支持 vLLM、llama.cpp 和 MLX 等运行环境,并在 IFEval 和 BFCLv3 等基准测试中表现优异。

    推荐理由:IBM 发布 3.5 亿至 15 亿参数模型,提供混合架构与传统 Transformer 两种选择,适合端侧部署。

10月15日周三
  1. Hugging Face Blog38

    三步在 Intel CPU 上运行 VLM

    Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上运行 SmolVLM2-256M-Video-Instruct 视觉语言模型。教程涵盖将模型转换为 OpenVINO IR、应用权重或静态量化以优化内存和推理速度,以及执行推理的具体步骤。

10月11日周六
10月2日周四
  1. Hugging Face Blog67

    Hugging Face 详解如何将 3B 参数 OCR 模型适配 Core ML 实现端侧推理

    Hugging Face 发布教程详解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为 Core ML 格式以在 Apple 设备上运行。文章通过简化模型结构、修复 PyTorch 到 CoreML 转换中的算子报错,成功将模型部署至端侧,并预告后续将介绍 MLX 集成与 Neural Engine 量化优化。

    推荐理由:详细拆解了将3B参数OCR模型适配Core ML的具体步骤与踩坑经验,为端侧部署提供了可复用的工程参考。

9月16日周二
  1. Hugging Face Blog65

    Hugging Face 发布 LeRobotDataset v3.0 支持流式读取与大规模存储

    Hugging Face 发布 LeRobotDataset v3.0,将多个片段合并存储以解决文件系统限制,并原生支持流式读取。该格式通过 Parquet 和 MP4 优化存储,提供一键转换脚本,将集成至 lerobot 库 v0.4.0 版本。

    推荐理由:通过多片段合并与流式读取解决大规模机器人数据集存储瓶颈,提供一键转换工具。

8月12日周二
  1. Hugging Face Blog42

    Arm 发布 Neural Super Sampling 实时超采样方案

    Arm 发布 Neural Super Sampling (NSS),一款专为移动端 GPU 神经网络加速器优化的实时时序超采样模型。在演示中,NSS 将 540p 渲染结果在 4ms 内超采样至 1080p,并降低 50% GPU 负载。该模型已集成至 Unreal Engine 插件及 Vulkan ML 扩展,供开发者在移动游戏和 XR 场景中实验。