VfL 沃尔夫斯堡将 ChatGPT 打造为俱乐部级能力
VfL 沃尔夫斯堡将 ChatGPT 打造为俱乐部级能力,通过聚焦人员而非试点项目,在保持足球身份的同时提升效率、创造力与知识水平。
VfL 沃尔夫斯堡将 ChatGPT 打造为俱乐部级能力,通过聚焦人员而非试点项目,在保持足球身份的同时提升效率、创造力与知识水平。
Google Research 发表论文,提出通过监督微调让大语言模型模仿贝叶斯助手,从而学会概率推理。该方法使模型在航班推荐任务中显著优于基线,并能将学到的推理能力泛化至酒店推荐和网购等未见领域。
推荐理由:研究提出通过模仿贝叶斯模型进行监督微调,使大模型学会概率推理并跨领域泛化。
GPT-5.2 Pro 协助推导并验证了量子引力中非零引力子树级振幅,将单减振幅扩展至引力子。
Axios 利用 AI 支持本地记者工作并优化新闻室流程,以规模化交付高影响力本地新闻。该公司 COO Allison Murphy 阐述了这一应用方式,旨在通过技术手段提升新闻生产的效率与覆盖面。
OpenAI 推出学习成果测量套件(Learning Outcomes Measurement Suite),旨在评估 AI 在不同教育环境及长期过程中对学生学习成果的影响。
Photoroom 开源 PRX 项目,展示了在 24 小时和 1500 美元预算内,利用像素空间训练、TREAD 路由、REPA 对齐和 Muon 优化器等技巧,从头训练文本到图像扩散模型的具体工程配方。
推荐理由:原文给出了在24小时和1500美元预算内训练文本到图像模型的具体工程配方,读者可以据此复现并优化自身的扩散模型训练流程。
Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。
推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。
OpenAI 公布了与国防部(Department of War)的协议细节,明确了安全红线、法律保障以及 AI 系统在机密环境中的部署方式。
推荐理由:官方披露了与国防部合作的安全红线与法律保障细节,有助于理解前沿AI在敏感场景下的部署边界。
OpenAI 与微软发布联合声明,确认双方继续在研究、工程及产品开发领域保持紧密合作。这一合作建立在多年深度协作与共同成功的基础之上。
Amazon Bedrock 推出面向智能体的有状态运行时环境,为基于 OpenAI 的多步 AI 工作流提供持久化编排、记忆和安全的执行能力。
推荐理由:Amazon Bedrock 为 OpenAI 模型提供持久化编排与记忆能力,有助于解决多步智能体工作流的状态管理问题。
OpenAI 宣布 1100 亿美元新投资,投前估值达 7300 亿美元。资金包括软银 300 亿美元、英伟达 300 亿美元和亚马逊 500 亿美元。
推荐理由:OpenAI 宣布 1100 亿美元融资及 7300 亿美元估值,明确了主要投资方与资金规模。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS,扩展 AI 基础设施、定制模型和企业级 AI 智能体。
推荐理由:OpenAI 将 Frontier 平台引入 AWS,为读者提供了评估企业级 AI 基础设施与智能体部署新路径的参考。
OpenAI 更新了其心理健康安全工作进展,涵盖家长控制、可信联系人、改进的 distress detection 功能以及近期诉讼动态。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。
推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。
OpenAI 与太平洋西北国家实验室联合推出 DraftNEPABench 基准,用于评估 AI 编码智能体在加速联邦许可审批方面的能力。该基准测试显示,AI 技术有望将 NEPA 起草时间缩短高达 15%,并推动基础设施审查的现代化。
OpenAI 与 Figma 推出新的 Codex 集成,实现代码与设计之间的无缝连接。该功能使团队能够在实现与 Figma 画布之间自由切换,从而加速迭代并更快交付产品。
Hugging Face 重构了 Transformers 库以原生支持 Mixture of Experts (MoE) 架构,引入动态权重加载与专家后端,使 Qwen1.5-110B 等模型加载速度提升数倍,并联合 Unsloth 实现 MoE 训练速度提升约 12 倍。
推荐理由:Hugging Face重构了MoE模型的权重加载与执行后端,显著提升了大参数模型的加载速度与训练效率。
OpenAI发布2026年2月威胁报告,深入剖析恶意行为者如何将AI模型与网站及社交平台结合。该报告重点探讨了此类组合对检测与防御工作带来的具体影响及应对挑战。
OpenAI 任命 Arvind KC 为首席人力资源官,旨在协助公司扩张、强化企业文化,并主导 AI 时代工作方式的演变。
OpenAI 指出 SWE-bench Verified 存在测试污染和训练数据泄露问题,已无法准确衡量前沿编码进展,并建议改用 SWE-bench Pro。
OpenAI 宣布成立前沿联盟(Frontier Alliance)合作伙伴计划,旨在协助企业将人工智能试点项目转化为生产环境。该计划重点支持安全、可扩展的 AI 智能体(Agent)部署,帮助组织实现从实验到实际应用的规模化落地。
OpenAI 分享了其 AI 模型在 First Proof 数学挑战中的证明尝试,旨在测试研究级推理能力以解决专家级问题。
Hugging Face 宣布 GGML 及其 llama.cpp 项目加入,核心维护者 Georgi Gerganov 团队将保持 100% 开源与自治。双方将致力于优化 ggml 软件的用户体验,并实现从 transformers 库到 llama.cpp 的无缝模型部署,为本地推理提供长期可持续的资源支持。
推荐理由:官方宣布核心维护者加入,承诺保持开源自治并优化本地部署体验,为本地AI生态提供长期资源保障。
Hugging Face 发布模型训练 Skill,允许用户通过 Claude Code 或 Codex 等编程智能体,利用 hf jobs CLI 提交任务,使用 Unsloth 在 Hugging Face Jobs 上快速微调 LiquidAI/LFM2.5-1.2B-Instruct 等小模型。
推荐理由:提供了通过编程智能体调用 Hugging Face Jobs 和 Unsloth 进行低成本微调的完整实操路径。
Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的得分,推理性能是 3 Pro 的两倍以上。该模型已在 Gemini API、Vertex AI、Gemini CLI、Android Studio 及 NotebookLM 等平台开放预览。
推荐理由:ARC-AGI-2得分翻倍体现推理能力跃升,覆盖开发者与企业场景,可据此评估复杂任务处理潜力。
OpenAI 向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。此举旨在加强全球应对 AGI 安全与风险的努力。
OpenAI 推出 OpenAI for India,旨在通过构建本地基础设施、赋能企业以及提升劳动力技能,扩大印度全国的 AI 普及范围。
IBM 与 UC Berkeley 发布 MAST 框架,对 IT-Bench 基准中 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 的 310 条 SRE 执行轨迹进行归因分析。研究发现前沿模型多因错误验证失败,而开源模型常因推理与行动不匹配导致级联崩溃,并据此提出针对性的工程修复策略。
推荐理由:文章提出 MAST 框架拆解智能体失败模式,揭示不同模型在验证与终止上的具体缺陷及工程修复路径。
Google DeepMind 在 Gemini App 中集成最新生成音乐模型 Lyria 3,支持用户通过文本描述或上传图片生成30秒带歌词的音乐曲目。该模型可自动生成歌词,并提供风格、人声和节奏等创意控制选项,同时内置 SynthID 水印及音频内容验证功能。
推荐理由:Gemini App 集成 Lyria 3 模型,支持文本或图片生成带歌词的30秒音乐,并内置 SynthID 水印与音频验证功能。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高严重性智能合约漏洞的能力。
Gradio 6 发布 gr.HTML 功能,支持自定义模板、作用域 CSS 和 JavaScript 交互。开发者可借助 LLM 在单个 Python 文件中生成前端、后端及状态管理,无需构建步骤即可部署至 Hugging Face Spaces。
推荐理由:Gradio 6 赋予 gr.HTML 原生模板与交互能力,使开发者能利用 LLM 单文件生成复杂组件,极大简化了 AI 应用的构建与部署流程。
Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。
推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。
Google DeepMind 宣布与印度政府建立 AI 伙伴关系,通过提供 AlphaFold、AlphaGenome 等前沿模型加速科学突破。Gemini 在印度学生中普及,并与 PM Publishers 合作将 200 万本教材转化为交互式数字内容。此外,Google.org 发起 3000 万美元 AI for Science 挑战以支持科研创新。
GPT-5.2 提出了一种新的胶子振幅公式,随后由 OpenAI 及学术合作者进行了形式化证明和验证。
推荐理由:GPT-5.2 提出胶子振幅新公式并获验证,展示了模型在理论物理领域的推理与发现能力。
OpenAI 在 ChatGPT 中推出锁定模式(Lockdown Mode)与高风险标签(Elevated Risk labels),旨在帮助组织防御提示注入和 AI 驱动的数据外泄。
推荐理由:ChatGPT 新增对抗提示注入和数据泄露的安全功能,为组织提供防护手段。
OpenAI 构建了结合速率限制、使用追踪和积分的实时访问系统,以实现对 Sora 和 Codex 的持续访问。该系统通过整合多种机制,解决了用户在使用这些 AI 产品时面临的访问限制问题。
OpenAI 发布开源工具包 GABRIEL,利用 GPT 将定性文本和图像转化为定量数据。该工具旨在帮助社会科学家大规模分析研究数据。
Hugging Face 发布了一个名为 cuda-kernels 的 Agent Skill,指导 Claude 和 Codex 等编码智能体编写生产级 CUDA 内核。
推荐理由:提供了将 CUDA 开发经验封装为 Agent Skill 的完整方案,并给出了在 H100 上针对 LTX-Video 和 Qwen3 的实测加速数据。
Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。
推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。
OpenAI 发布 GPT-5.3-Codex-Spark,这是其首款实时编码模型,生成速度提升15倍,支持128k上下文,目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:官方宣布推出实时编码模型,给出15倍加速与128k上下文,可据此评估对开发者工作流的实际提升。