TII 发布 Falcon ASR 语音识别模型,支持阿联酋方言
TII 发布 Falcon ASR 语音识别模型,参数量 1.6B,针对阿联酋方言优化并支持英语、法语、西班牙语和葡萄牙语。在公开基准上平均词错率(WER)为 20.92%,优于此前最佳结果,并提供在线 Demo 体验。
推荐理由:模型针对阿联酋方言优化并支持多语种,提供了可验证的基准成绩与在线体验入口。
TII 发布 Falcon ASR 语音识别模型,参数量 1.6B,针对阿联酋方言优化并支持英语、法语、西班牙语和葡萄牙语。在公开基准上平均词错率(WER)为 20.92%,优于此前最佳结果,并提供在线 Demo 体验。
推荐理由:模型针对阿联酋方言优化并支持多语种,提供了可验证的基准成绩与在线体验入口。
Google DeepMind 发布 EmbeddingGemma 2,这是一个基于 Gemma 4 架构的 7.4 亿参数多模态嵌入模型,原生支持文本、代码、图像、音频和视频的统一嵌入空间。
推荐理由:7.4亿参数原生多模态模型,支持端侧运行与向量截断,适合隐私优先的本地检索场景。
Reflection 发布 Beam,一款 501B 总参数 / 23B 激活参数的 MoE 代码模型,声称在 SWE-bench Verified 上得分 80.9,推理效率是 GLM 5.2 的 3–4 倍。该模型使用 23.8T 预训练 token 从头训练,全量权重将于本月以 Apache 2.0 协议开源。
Ai2 开源了 AstaBrief 8B 模型,该模型基于 Qwen3-8B 微调,专为快速生成带引用的科学文献综述报告而设计。在 Asta 平台中,该模型作为 Fast 模式上线,报告生成速度比原有的 Thinking 模式快约 3.5 倍,同时保持了相近的引用准确性和用户满意度。
推荐理由:开源了针对科学报告生成的轻量模型,提供了一整套数据筛选与评估方法,可迁移至其他垂直领域。
Google DeepMind 开源了 WeatherNext 2 和 WeatherNext Cyclones 模型及代码,该模型在气旋预测上实现了突破,平均提供额外一天的预测精度。模型仅需 28x28km 的低分辨率输入即可达到 SOTA 精度,并支持生成 1,000 个场景的集合预测。
推荐理由:开源了WeatherNext系列模型与代码,为气象预测提供了突破性的AI工具。
Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。
推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用扩散机制并行生成文本,在单卡 H100 上推理速度提升 4 倍,适用于本地低并发场景。
推荐理由:模型采用扩散机制实现并行生成,在本地低并发场景下推理速度提升显著,适合对延迟敏感的应用。
NVIDIA 在 Hugging Face 开源 Nemotron 3 Nano Omni 多模态理解模型,原生支持文档、图像、视频和音频的联合推理及智能体操作。该模型基于 Nemotron 3 混合 Mamba-Transformer 架构,在文档理解、视频分析和语音交互等基准测试中表现领先,并提供 BF16、FP8 和 NVFP4 权重下载。
推荐理由:NVIDIA 开源 Nemotron 3 Nano Omni 模型,原生支持图文音视频多模态理解与智能体操作,在多项基准上表现领先。
TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。
推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。