Google 发布 Gemini 2.5 Flash Native Audio 并上线实时语音翻译
Google 发布 Gemini 2.5 Flash Native Audio 模型,提升复杂工作流处理与指令遵循能力,已在 Vertex AI 和 Gemini API 上线。同时推出实时语音翻译功能,保留说话人语调,已在 Google Translate 应用上线。
推荐理由:更新原生音频模型并上线实时语音翻译,提供具体评测指标与应用入口。
Google 发布 Gemini 2.5 Flash Native Audio 模型,提升复杂工作流处理与指令遵循能力,已在 Vertex AI 和 Gemini API 上线。同时推出实时语音翻译功能,保留说话人语调,已在 Google Translate 应用上线。
推荐理由:更新原生音频模型并上线实时语音翻译,提供具体评测指标与应用入口。
Google 联合非洲数据科学社区举办 Data Science for Health Ideathon,利用 MedGemma、TxGemma 和 MedSigLIP 等开源健康 AI 模型解决当地医疗挑战。
BNY 借助 OpenAI 推出 Eliza 平台,推动企业级 AI 全面普及。该平台已支持超过 20,000 名员工自主构建 AI 智能体,旨在通过提升工作效率优化客户服务成果。
BBVA 与 OpenAI 达成多年期 AI 转型合作,向全部 12 万名员工部署 ChatGPT Enterprise。双方将共同开发 AI 解决方案,以优化客户互动、简化运营并构建原生 AI 银行体验。
OpenAI 利用 Codex 在 28 天内完成了 Sora for Android 的发布。AI 辅助的规划、翻译和并行编码工作流帮助团队实现了快速且可靠的开发。
llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。
推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。
OpenAI 发布 GPT-5.2 模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新纪录,展示了在解决开放理论问题和生成可靠数学证明方面的能力。
推荐理由:GPT-5.2在科学和数学基准上刷新纪录,展示了在解决开放理论问题和生成可靠数学证明方面的实际科研进展。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型与数据,重点开展思维链监控、社会情感影响及经济系统评估等研究。此举旨在通过更稳健的评估方法,确保前沿 AI 系统的安全与责任。
OpenAI 与迪士尼达成合作,将 200 多个迪士尼、漫威、皮克斯和星球大战角色引入 Sora 用于创作粉丝短片。该协议强调娱乐领域的负责任 AI,并包含迪士尼全面使用 ChatGPT Enterprise 和 OpenAI API。
推荐理由:OpenAI 与迪士尼达成合作,将 200 多个角色引入 Sora,体现了前沿模型在娱乐领域的商业化落地。
OpenAI 发布 GPT-5 系列最新模型 GPT-5.2,并更新系统卡片。该模型的安全缓解方案与 GPT-5.1 基本一致,训练数据包含公开互联网信息、第三方合作信息及用户或研究人员提供的数据。
OpenAI 回顾过去十年从早期研究突破到重塑可能性的广泛使用的 AI 系统的进展。公司分享了来自过去十年的经验教训,并阐述了为何对构建造福全人类的 AGI 保持乐观。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型已上线 ChatGPT 和 OpenAI API,旨在支持更快、更可靠的智能体工作流。
推荐理由:GPT-5.2 定位为日常专业工作的前沿模型,强化了推理、长上下文、编码与视觉能力,旨在优化 ChatGPT 和 API 中的智能体工作流。
Podium 基于 OpenAI 的 GPT-5 构建了名为“Jerry”的 AI 智能体,旨在帮助中小企业提升客户服务能力。该智能体已助力超过 10,000 家中小企业实现 300% 的业务增长,正在改变街边商铺的服务模式。
Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。
Google DeepMind 宣布深化与英国政府的合作,旨在通过提供前沿 AI 工具加速科学发现、教育现代化及国家安全建设。双方将建立首个自动化科学实验室,优先向英国科学家开放 AlphaEvolve 等模型,并探索 Gemini 在教育与公共服务中的规模化应用。
OpenAI 正通过加强防御能力和安全措施,应对 AI 模型在网络领域日益增强的能力。该公司阐述了如何评估风险、限制滥用,并与安全社区合作以增强网络弹性。
Scout24 推出了基于 GPT-5 的对话式助手,重新定义了房地产搜索体验。该助手通过澄清性问题、摘要及定制化房源推荐引导用户。
Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。
推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,包含参数知识、搜索、多模态及 Grounding v2 共 3,513 个公开测试用例。评测显示 Gemini 3 Pro 以 68.8% 的 FACTS Score 领先,所有模型准确率均低于 70%,多模态任务得分最低。
推荐理由:提供涵盖参数知识、搜索与多模态的4项事实性评测基准,揭示前沿模型在事实准确性上的具体短板。
OpenAI 联合发起 Linux 基金会下的智能体 AI 基金会,并捐赠 AGENTS.md 以支持安全智能体 AI 的开放互操作标准。
推荐理由:OpenAI 联合发起 Linux 基金会下的智能体 AI 基金会并捐赠 AGENTS.md,旨在推动安全智能体 AI 的开放互操作标准。
OpenAI 推出首批 OpenAI 认证课程及 AI 基础课程。这些课程旨在帮助人们建立实际的 AI 技能,提升职业机会,并为未来工作做好准备。
OpenAI 任命 Denise Dresser 为首席营收官,负责监督企业在客户成功方面的全球营收战略。她将协助更多企业将 AI 融入日常运营,以支持 OpenAI 的持续扩展。
OpenAI 与 Deutsche Telekom 合作,将先进的多语言 AI 体验带给欧洲数百万用户。ChatGPT Enterprise 也将部署至 Deutsche Telekom,帮助员工改进工作流程并加速创新。
澳大利亚联邦银行与 OpenAI 合作,向 50,000 名员工推广 ChatGPT Enterprise,旨在大规模构建 AI 熟练度。该举措通过提升员工在客户服务和欺诈响应方面的能力,优化业务运营效率。
Instacart 与 OpenAI 深化合作,在 ChatGPT 中推出首个完全整合的杂货购物及 Instant Checkout 支付应用。该功能将购物流程与支付环节深度融合,旨在为用户提供更便捷的 AI 购物体验。
OpenAI 2025 年企业数据显示,AI 采用率加速提升,集成程度加深,并在各行业带来可衡量的生产力增长。
维珍大西洋航空首席财务官 Oliver Byers 分享了该公司利用人工智能加速开发、优化决策并提升客户体验的实践。
Hugging Face 发布 swift-huggingface,为 Swift 应用提供完整的 Hugging Face Hub 客户端支持。该库解决了大模型下载中断无法续传、缺乏 Python 共享缓存及认证复杂等痛点,支持断点续传、OAuth 2.0 认证及与 Python 生态兼容的缓存结构。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
OpenAI 推出 OpenAI for Australia,旨在构建主权 AI 基础设施、培训超过 150 万工人,并加速澳大利亚日益增长的 AI 生态系统的创新。
密歇根州立大学团队利用 AlphaFold 预测植物甘油酸激酶(GLYK)的 3D 结构,识别出高温下不稳定的柔性环,并将其替换为耐热藻类的刚性环,成功构建了在 65 °C 下仍保持稳定的杂交酶,为培育耐热作物提供了新路径。
Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。
推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。
Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。
推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。
Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。
OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升人工智能的诚实度、透明度以及对模型输出的信任感。
OpenAI 宣布收购 Neptune,旨在深化对模型行为的可见性,并加强研究人员用于追踪实验和监控训练的工具。
OpenAI 基金会公布了首批“以人为本 AI 基金”受助者,向 208 家支持社区创新与机遇的非营利组织发放了 4050 万美元的无限制赠款。
Mistral AI 发布 Mistral 3 模型家族,包含 Mistral Large 3 及 Ministral 3 系列(3B、8B、14B),均采用 Apache 2.0 协议开源。
推荐理由:Mistral 3 家族涵盖从 3B 到 675B 参数的模型,提供全尺寸开源选择,并针对边缘部署和推理性能进行了深度优化。
Mirakl 正在通过 AI 智能体和 ChatGPT Enterprise 重塑商业体验,旨在构建以 Mirakl Nexus 为核心的智能体原生商业生态。该方案利用 ChatGPT Enterprise 实现更快的文档处理和更智能的客户支持,推动商业向智能体原生模式演进。
OpenAI 提供高达 200 万美元的资助,用于支持 AI 与心理健康交叉领域的研究项目。该计划旨在通过研究实际应用中的风险、益处及效果,提升相关技术的安全性与用户福祉。