跳到正文

全部动态

今日 0 条
10月8日周四
  1. The Decoder82

    Anthropic 发布 Claude Haiku 5.5 并大幅降价

    Anthropic 发布 Claude Haiku 5.5,支持可调节推理级别,针对 10 万 token 以下提示词降价最高 90%。该模型在计算机使用和编码任务上表现显著提升,同时 Sonnet 5.5 缓存读取成本减半。

    推荐理由:Anthropic 大幅降价并推出可调节推理的 Haiku 5.5,为高频低成本场景提供了新的选型参考。

  2. Latent Space90

    Anthropic发布Claude Haiku 5.5并调整Sonnet 5.5定价

    Anthropic发布Claude Haiku 5.5,定价与GPT-6 Luna持平,支持1M上下文和Effort设置,定位为多模型智能体中的低成本子智能体。同日Anthropic下调Sonnet 5.5缓存读取价格,并更新SDK内置Computer-use工具集。

    推荐理由:Anthropic发布Haiku 5.5并调整Sonnet定价,为多模型智能体工作流提供了低成本替代方案。

10月7日周三
  1. Hugging Face Blog62

    TII 发布 Falcon ASR 语音识别模型,支持阿联酋方言

    TII 发布 Falcon ASR 语音识别模型,参数量 1.6B,针对阿联酋方言优化并支持英语、法语、西班牙语和葡萄牙语。在公开基准上平均词错率(WER)为 20.92%,优于此前最佳结果,并提供在线 Demo 体验。

    推荐理由:模型针对阿联酋方言优化并支持多语种,提供了可验证的基准成绩与在线体验入口。

  2. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

  3. OpenAI News85

    GPT-6 伴随智能界面全球上线

    OpenAI 宣布 GPT-6 在 ChatGPT 中全球上线,并推出智能界面(Intelligent UI),提供包含视觉和交互体验的更快响应。

    推荐理由:GPT-6 伴随智能界面全球上线,提供包含视觉与交互体验的更快响应,直接改变 ChatGPT 的使用方式。

10月6日周二
  1. Mistral AI92

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。

    推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。

10月2日周五
  1. Hugging Face Blog65

    Ai2 开源 AstaBrief 8B 科学报告生成模型

    Ai2 开源了 AstaBrief 8B 模型,该模型基于 Qwen3-8B 微调,专为快速生成带引用的科学文献综述报告而设计。在 Asta 平台中,该模型作为 Fast 模式上线,报告生成速度比原有的 Thinking 模式快约 3.5 倍,同时保持了相近的引用准确性和用户满意度。

    推荐理由:开源了针对科学报告生成的轻量模型,提供了一整套数据筛选与评估方法,可迁移至其他垂直领域。

10月1日周四
  1. Ars Technica · AI83

    Google 发布 Gemini 4 Argon 模型,API 定价与百万级输出已公布

    Google 发布 Gemini 4 Argon 模型,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token,支持 100 万 token 输出。该模型在 DeepSWE v1.1 基准测试中得分 77.9%,已用于内部代码迁移并节省大量内存。

    推荐理由:Argon 提供百万级输出与工程基准领先数据,可评估其在长程任务与代码重构中的实际价值。

  2. Google DeepMind90

    Google 发布 Gemini 4 Argon 模型,输出上限扩至 100 万 token

    Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。

    推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。

9月3日周四
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.8 Flash 及网络安全版

    Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。

    推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。

8月25日周二
  1. Hugging Face Blog82

    IBM 发布 Granite 4.2 推理模型系列

    IBM 发布 Granite 4.2 推理模型系列,包含 3B、8B 和 30B 三个尺寸,采用密集解码器架构并支持思考模式切换与原生工具调用。模型基于约 15T token 预训练,并通过包含 SWE、终端和搜索的多阶段强化学习进行后训练,在 SWE-bench Verified 等基准上表现强劲。

    推荐理由:原文披露了从预训练到多阶段强化学习的完整构建细节,为同类模型提供了可迁移的技术参考。

8月21日周五
  1. Hugging Face Blog75

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.2 倍

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,为 LFM2.5 系列模型提供推测解码路径,在 H100 上最高实现 3.18 倍吞吐提升,在 M4 Max 上最高实现 2.87 倍提升。该方案已开源并支持 llama.cpp 和 SGLang,在保持输出质量不变的前提下显著降低延迟。

    推荐理由:原文给出了具体加速数据与部署配置,读者可据此评估端侧交互体验提升与现有工作流的适配度。

8月10日周一
  1. Hugging Face Blog85

    Meta 发布 Muse Glimmer 30B 多模态模型

    Meta 发布 Muse Glimmer 30B 多模态模型,专为本地智能体场景设计,采用 2B 视觉编码器与 28B 文本解码器架构。该模型开源并提供 transformers、llama.cpp 及 vLLM 支持,具备多模态工具调用与代码生成能力,演示了模型自量化与自部署等智能体应用。

    推荐理由:Meta 发布 30B 多模态模型,针对本地智能体场景优化,提供多种推理框架支持与自部署演示。

7月15日周三
  1. Hugging Face Blog86

    Thinking Machines 开源 Inkling 1T参数多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。

    推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。

6月2日周二
6月1日周一
  1. Hugging Face Blog72

    JetBrains 发布 Mellum2 12B MoE 模型

    JetBrains 发布 Mellum2,一个 12B 参数的 MoE 模型,每 token 仅激活 2.5B 参数,推理速度比同类模型快 2 倍以上。该模型开源并支持 Apache 2.0 协议,适用于路由、RAG、子智能体和私有部署。

    推荐理由:原文给出了模型架构和性能数据,读者可以据此评估它在多模型系统中的路由和编排价值。

5月20日周三
  1. Hugging Face Blog68

    OlmoEarth v1.1 发布:计算成本降低至三分之一

    AllenAI 发布 OlmoEarth v1.1 模型系列,通过优化 Transformer 的 Token 设计将计算成本降低至 v1 的三分之一,同时保持基准性能。该版本包含 Base、Tiny 和 Nano 多种尺寸,支持更高效的卫星图像推理与微调。

    推荐理由:通过优化Token设计降低计算成本,为遥感模型的高效部署提供了可复用的工程实践。

5月15日周五
4月29日周三
  1. Hugging Face Blog78

    IBM 发布 Granite 4.1 系列开源大语言模型

    IBM 发布 Granite 4.1 系列(3B、8B、30B)开源大语言模型,采用 Apache 2.0 协议。该系列在约 15T tokens 上预训练并支持 512K 上下文,通过多阶段强化学习显著提升了数学、编码和工具调用能力。其中 8B 模型在多项基准上匹敌或超越前代 32B MoE 模型。

    推荐理由:原文详述了数据工程与多阶段强化学习等训练细节,展示了8B密集模型在多项基准上匹敌更大MoE架构的能力。

4月28日周二
  1. Hugging Face Blog83

    NVIDIA 开源 Nemotron 3 Nano Omni 多模态模型

    NVIDIA 在 Hugging Face 开源 Nemotron 3 Nano Omni 多模态理解模型,原生支持文档、图像、视频和音频的联合推理及智能体操作。该模型基于 Nemotron 3 混合 Mamba-Transformer 架构,在文档理解、视频分析和语音交互等基准测试中表现领先,并提供 BF16、FP8 和 NVFP4 权重下载。

    推荐理由:NVIDIA 开源 Nemotron 3 Nano Omni 模型,原生支持图文音视频多模态理解与智能体操作,在多项基准上表现领先。