OpenAI 为 GPT-4o 微调 API 新增图像输入支持
OpenAI 宣布开发者现在可以使用图像和文本对 GPT-4o 进行微调,以增强模型的视觉能力。
推荐理由:GPT-4o 微调 API 新增图像输入支持,开发者可利用图文数据优化模型视觉能力。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
OpenAI 宣布开发者现在可以使用图像和文本对 GPT-4o 进行微调,以增强模型的视觉能力。
推荐理由:GPT-4o 微调 API 新增图像输入支持,开发者可利用图文数据优化模型视觉能力。
Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。
推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。
Hugging Face 发布基于 BitNet 架构的 LLaMA3 8B 1.58bit 模型,公开了通过动态 Lambda 调度实现微调的技术细节与 Triton 自定义内核,模型在 MMLU 等基准上表现优异。
推荐理由:文章公开了将LLaMA3微调至1.58bit的量化方法与代码,为降低大模型推理成本提供了可复用的工程方案。
Mistral AI 发布 Mistral Small v24.09 模型,下调全线模型 API 价格,并推出 la Plateforme 免费层。le Chat 免费开放 Pixtral 12B 视觉能力,支持任意尺寸图片理解。
推荐理由:官方同步更新模型定价与发布新模型,提供了免费层与Apache 2.0授权,便于评估成本与部署方案。
Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。
推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。
Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。
推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。
HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。
推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。
Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。
推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。
OpenAI 宣布 GPT-4o 现已开放微调功能。
推荐理由:GPT-4o 开放微调功能,开发者可据此优化模型在特定任务上的表现。
Mistral 宣布在 La Plateforme 开放 Mistral Large 2 和 Codestral 等旗舰模型的自定义微调,并推出包裹模型与指令的 Agents 功能以支持复杂工作流。同时发布 mistralai 1.0 稳定版 SDK,涵盖 Python 和 Typescript。
推荐理由:官方同步开放旗舰模型微调、Agent 框架及 SDK 1.0,开发者可据此快速构建定制化应用。
OpenAI 在 API 中引入结构化输出功能,使模型输出现在能可靠地遵循开发者提供的 JSON Schema。
推荐理由:API 新增结构化输出功能,使模型输出稳定符合 JSON Schema,降低开发者解析成本。
Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope。
推荐理由:Google 发布 Gemma 2 2B 及 ShieldGemma 等新品,提供端侧部署与安全能力更新。
Mistral 发布 Codestral Mamba,这是一款基于 Mamba 架构的 7B 参数代码模型,支持 Apache 2.0 开源协议。该模型具备线性时间推理能力,可处理长达 256k tokens 的上下文,在代码生成与推理任务上表现媲美 SOTA Transformer 模型。
推荐理由:Mistral 发布基于 Mamba 架构的 7B 代码模型,提供线性推理与长上下文优势,支持本地部署。
Hugging Face 宣布在 Inference Endpoints 和 Spaces 中支持 Google Cloud TPU v5e。提供 v5litepod-1/4/8 三种实例配置,价格分别为每小时 1.375 美元、5.50 美元和 11.00 美元。配套开源库 Optimum TPU 支持部署 Gemma、Llama 和 Mistral 等模型。
推荐理由:Hugging Face 联合 Google 开放 TPU v5e 部署,提供明确实例配置与价格,便于开发者评估推理成本。
Hugging Face 发布独立库 smolagents,其前身 Transformers Agents 基于 Code Agent 在 GAIA 基准测试验证集上取得 44.2% 的成绩排名第一。该方案通过代码执行、安全解释器及多智能体编排,展示了代码动作在复杂任务中的优势。
推荐理由:文章分享了基于代码智能体在GAIA基准测试中取得高分的技术细节,为构建复杂Agent系统提供了可迁移的实践经验。
Google 发布 Gemma 2 开源大语言模型,包含 9B 和 27B 两种参数规模。该模型在训练数据量、滑动窗口注意力、Logit 软截断及知识蒸馏等方面进行了技术升级,并在多项基准测试中表现优异。Hugging Face 已提供 Transformers 集成、微调工具及推理端点支持。
推荐理由:文章详细拆解了Gemma 2的技术改进与生态集成,为开发者评估和部署提供了具体参考。
Hugging Face 在 TRL 中引入 RLOO 算法作为 PPO 的替代方案,用于在线 RLHF 训练。该算法将完整回复视为单一动作,显存占用降低 50-70%,训练速度提升 2-3 倍,且在 Pythia 模型上表现优于 DPO。
推荐理由:TRL 引入 RLOO 算法替代 PPO,显著降低显存占用并提升训练速度,为在线 RLHF 提供了更高效的工程方案。
Hugging Face Diffusers 正式支持 Stability AI 发布的 Stable Diffusion 3 Medium (SD3) 模型。该模型包含20亿参数,采用多模态扩散Transformer架构和条件流匹配训练。文章提供了在Diffusers中运行推理、使用显存优化技术以及在A100上实现4倍加速的代码示例,并附带了基于LoRA的微调脚本。
推荐理由:文章详细拆解了SD3 Medium的架构与训练方法,并提供了在Diffusers中运行及微调的具体代码和显存优化方案。
OpenAI与苹果宣布达成合作,计划将ChatGPT整合进苹果的体验中。
推荐理由:OpenAI与苹果宣布合作将ChatGPT整合进苹果生态,为理解两大巨头在端侧AI的协同提供了关键事实。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。