Overworld 发布 Waypoint-1 实时交互视频扩散模型
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。
Hugging Face 发布 AnyLanguageModel,提供 Swift 包统一调用 Apple Foundation Models、Core ML、MLX、llama.cpp、Ollama 及 OpenAI 等模型。开发者只需替换 import 即可切换后端,支持按需引入依赖并扩展图像输入。
推荐理由:统一了本地与云端模型调用接口,降低 Apple 平台开发者的集成成本。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的医疗机器人端到端工作流。通过结合 93% 仿真数据与真实遥操作数据微调 GR00T N1.5 模型,实现从数据采集、训练到硬件部署的 Sim2Real 闭环。
推荐理由:提供了从仿真到部署的完整代码与硬件配置,可直接复现医疗机器人工作流。
IBM 发布 Granite 4.0 Nano 系列模型,包含 350M 和 1B 参数版本,采用混合 SSM 架构或传统 Transformer 架构,面向端侧和 On-device 应用。模型基于 15T tokens 数据训练,支持 vLLM、llama.cpp 和 MLX 等运行环境,并在 IFEval 和 BFCLv3 等基准测试中表现优异。
推荐理由:IBM 发布 3.5 亿至 15 亿参数模型,提供混合架构与传统 Transformer 两种选择,适合端侧部署。
Hugging Face 发布教程详解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为 Core ML 格式以在 Apple 设备上运行。文章通过简化模型结构、修复 PyTorch 到 CoreML 转换中的算子报错,成功将模型部署至端侧,并预告后续将介绍 MLX 集成与 Neural Engine 量化优化。
推荐理由:详细拆解了将3B参数OCR模型适配Core ML的具体步骤与踩坑经验,为端侧部署提供了可复用的工程参考。
Hugging Face 发布 LeRobotDataset v3.0,将多个片段合并存储以解决文件系统限制,并原生支持流式读取。该格式通过 Parquet 和 MP4 优化存储,提供一键转换脚本,将集成至 lerobot 库 v0.4.0 版本。
推荐理由:通过多片段合并与流式读取解决大规模机器人数据集存储瓶颈,提供一键转换工具。
ExecuTorch 0.7 beta 发布,默认启用 KleidiAI 加速,利用 Arm SDOT 指令集为旧款手机和树莓派等设备提供开箱即用的端侧推理性能。
推荐理由:ExecuTorch 0.7 默认启用 KleidiAI 并支持旧款设备,为端侧推理提供了开箱即用的性能优化方案。
Mistral AI 发布 Mistral Small 3,这是一款 24B 参数、采用 Apache 2.0 协议开源的延迟优化模型。该模型在多项基准测试中表现媲美 Llama 3.3 70B 和 GPT-4o-mini,但在相同硬件上速度提升 3 倍以上。模型未使用强化学习或合成数据训练,适合本地部署、快速响应对话及智能体工作流,现已在 Hugging Face、Ollama 等平台上线。
推荐理由:24B参数模型在保持低延迟的同时性能媲美更大模型,为本地部署和智能体工作流提供了高性价比的开源选择。
Mistral AI 发布 Mistral Small v24.09 模型,下调全线模型 API 价格,并推出 la Plateforme 免费层。le Chat 免费开放 Pixtral 12B 视觉能力,支持任意尺寸图片理解。
推荐理由:官方同步更新模型定价与发布新模型,提供了免费层与Apache 2.0授权,便于评估成本与部署方案。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。