跳到正文

全部动态

今日 21 条
3月5日周四
  1. Google Research65

    Google Research:通过模仿贝叶斯模型训练大语言模型

    Google Research 发表论文,提出通过监督微调让大语言模型模仿贝叶斯助手,从而学会概率推理。该方法使模型在航班推荐任务中显著优于基线,并能将学到的推理能力泛化至酒店推荐和网购等未见领域。

    推荐理由:研究提出通过模仿贝叶斯模型进行监督微调,使大模型学会概率推理并跨领域泛化。

3月4日周三
  1. Hugging Face Blog75

    Photoroom 发布 PRX 开源项目:24小时训练文本到图像模型

    Photoroom 开源 PRX 项目,展示了在 24 小时和 1500 美元预算内,利用像素空间训练、TREAD 路由、REPA 对齐和 Muon 优化器等技巧,从头训练文本到图像扩散模型的具体工程配方。

    推荐理由:原文给出了在24小时和1500美元预算内训练文本到图像模型的具体工程配方,读者可以据此复现并优化自身的扩散模型训练流程。

  2. Google DeepMind83

    Google 发布 Gemini 3.1 Flash-Lite 模型

    Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。

    推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。

2月28日周六
  1. OpenAI News73

    OpenAI 公布与国防部合作协议细节

    OpenAI 公布了与国防部(Department of War)的协议细节,明确了安全红线、法律保障以及 AI 系统在机密环境中的部署方式。

    推荐理由:官方披露了与国防部合作的安全红线与法律保障细节,有助于理解前沿AI在敏感场景下的部署边界。

2月27日周五
  1. OpenAI News63

    OpenAI 与 Amazon 宣布战略合作

    OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS,扩展 AI 基础设施、定制模型和企业级 AI 智能体。

    推荐理由:OpenAI 将 Frontier 平台引入 AWS,为读者提供了评估企业级 AI 基础设施与智能体部署新路径的参考。

  2. Google DeepMind83

    Google 发布 Nano Banana 2 图像生成模型

    Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。

    推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。

2月26日周四
  1. Hugging Face Blog75

    Hugging Face Transformers 重构 MoE 权重加载与执行后端

    Hugging Face 重构了 Transformers 库以原生支持 Mixture of Experts (MoE) 架构,引入动态权重加载与专家后端,使 Qwen1.5-110B 等模型加载速度提升数倍,并联合 Unsloth 实现 MoE 训练速度提升约 12 倍。

    推荐理由:Hugging Face重构了MoE模型的权重加载与执行后端,显著提升了大参数模型的加载速度与训练效率。

2月25日周三
2月24日周二
2月23日周一
  1. OpenAI News30

    OpenAI 宣布前沿联盟合作伙伴

    OpenAI 宣布成立前沿联盟(Frontier Alliance)合作伙伴计划,旨在协助企业将人工智能试点项目转化为生产环境。该计划重点支持安全、可扩展的 AI 智能体(Agent)部署,帮助组织实现从实验到实际应用的规模化落地。

2月20日周五
  1. Hugging Face Blog78

    GGML 与 llama.cpp 加入 Hugging Face 以推动 Local AI 长期发展

    Hugging Face 宣布 GGML 及其 llama.cpp 项目加入,核心维护者 Georgi Gerganov 团队将保持 100% 开源与自治。双方将致力于优化 ggml 软件的用户体验,并实现从 transformers 库到 llama.cpp 的无缝模型部署,为本地推理提供长期可持续的资源支持。

    推荐理由:官方宣布核心维护者加入,承诺保持开源自治并优化本地部署体验,为本地AI生态提供长期资源保障。

  2. Hugging Face Blog75

    使用编程智能体配合 Unsloth 和 Hugging Face Jobs 免费微调模型

    Hugging Face 发布模型训练 Skill,允许用户通过 Claude Code 或 Codex 等编程智能体,利用 hf jobs CLI 提交任务,使用 Unsloth 在 Hugging Face Jobs 上快速微调 LiquidAI/LFM2.5-1.2B-Instruct 等小模型。

    推荐理由:提供了通过编程智能体调用 Hugging Face Jobs 和 Unsloth 进行低成本微调的完整实操路径。

  3. Google DeepMind80

    Gemini 3.1 Pro 发布,ARC-AGI-2 得分翻倍

    Google DeepMind 发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的得分,推理性能是 3 Pro 的两倍以上。该模型已在 Gemini API、Vertex AI、Gemini CLI、Android Studio 及 NotebookLM 等平台开放预览。

    推荐理由:ARC-AGI-2得分翻倍体现推理能力跃升,覆盖开发者与企业场景,可据此评估复杂任务处理潜力。

2月19日周四
  1. Hugging Face Blog78

    IBM 与 UC Berkeley 发布 MAST 框架诊断 IT-Bench 智能体失败原因

    IBM 与 UC Berkeley 发布 MAST 框架,对 IT-Bench 基准中 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 的 310 条 SRE 执行轨迹进行归因分析。研究发现前沿模型多因错误验证失败,而开源模型常因推理与行动不匹配导致级联崩溃,并据此提出针对性的工程修复策略。

    推荐理由:文章提出 MAST 框架拆解智能体失败模式,揭示不同模型在验证与终止上的具体缺陷及工程修复路径。

  2. Google DeepMind72

    Gemini App 集成 Lyria 3 模型,支持文本或图片生成音乐

    Google DeepMind 在 Gemini App 中集成最新生成音乐模型 Lyria 3,支持用户通过文本描述或上传图片生成30秒带歌词的音乐曲目。该模型可自动生成歌词,并提供风格、人声和节奏等创意控制选项,同时内置 SynthID 水印及音频内容验证功能。

    推荐理由:Gemini App 集成 Lyria 3 模型,支持文本或图片生成带歌词的30秒音乐,并内置 SynthID 水印与音频验证功能。

2月18日周三
  1. Hugging Face Blog75

    Gradio 6 发布 gr.HTML 单文件应用功能

    Gradio 6 发布 gr.HTML 功能,支持自定义模板、作用域 CSS 和 JavaScript 交互。开发者可借助 LLM 在单个 Python 文件中生成前端、后端及状态管理,无需构建步骤即可部署至 Hugging Face Spaces。

    推荐理由:Gradio 6 赋予 gr.HTML 原生模板与交互能力,使开发者能利用 LLM 单文件生成复杂组件,极大简化了 AI 应用的构建与部署流程。

  2. Google Research68

    Google发布MapTrace合成数据管线,提升多模态大模型地图路径追踪能力

    Google发布MapTrace合成数据生成管线,利用Gemini和Imagen模型生成200万对地图与路径数据。在Gemma 3 27B和Gemini 2.5 Flash上微调后,模型在MapBench基准上的路径追踪误差显著降低,成功率大幅提升。

    推荐理由:提出MapTrace合成数据生成管线,通过微调显著提升多模态大模型在地图路径追踪任务上的空间推理能力。

2月17日周二
2月13日周五
  1. Google DeepMind85

    Gemini 3 Deep Think 重大升级并开放 API 访问

    Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。

    推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。

2月12日周四
  1. OpenAI News77

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 发布 GPT-5.3-Codex-Spark,这是其首款实时编码模型,生成速度提升15倍,支持128k上下文,目前面向 ChatGPT Pro 用户开放研究预览。

    推荐理由:官方宣布推出实时编码模型,给出15倍加速与128k上下文,可据此评估对开发者工作流的实际提升。