OpenAI 发布 o1 模型的新对齐策略
OpenAI 发布针对 o1 模型的新对齐策略,直接教授模型安全规范及其推理能力。
推荐理由:原文介绍了o1模型的新对齐策略,读者可据此了解模型安全机制的演进方向。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
OpenAI 发布针对 o1 模型的新对齐策略,直接教授模型安全规范及其推理能力。
推荐理由:原文介绍了o1模型的新对齐策略,读者可据此了解模型安全机制的演进方向。
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。
推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。
Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena,这是一个针对 AI 聊天机器人数据隐私的对抗性压力测试平台。该平台包含 12 款结合 RLHF 及 NeMo Guardrails、LlamaGuard 等防护措施的模型,用户通过盲测尝试诱导模型泄露虚构银行的敏感信息,投票结果将基于 Elo 评级系统生成公开的隐私安全排行榜。
推荐理由:Hugging Face联合推出隐私对抗测试平台,通过盲测对比12款模型防泄露能力,提供可迁移的安全评估基准。
Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。
推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。
Hugging Face 在 alignment-handbook 中实测对比了 DPO、IPO 和 KTO 三种无需强化学习的偏好对齐算法。实验基于 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 模型,使用 MT-Bench 评估发现 DPO 在成对偏好设置中表现最佳,且对超参数 beta 的敏感性因基座模型而异。
推荐理由:通过MT-Bench实测对比DPO、IPO、KTO三种对齐算法,揭示了超参数敏感性并给出最佳实践参考。
OpenAI 宣布启动 1000 万美元的 Superalignment Fast Grants 专项基金,旨在支持针对超人类 AI 系统对齐与安全的技术研究,涵盖弱到强泛化、可解释性及可扩展监督等方向。
推荐理由:OpenAI 设立千万美元专项基金支持超人类 AI 的对齐与安全研究,为相关领域提供资金支持。
Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。
推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。
Hugging Face 发布研究,对比人类标注与 GPT-4 对开源模型(Vicuna、Koala 等)的偏好评估,发现 GPT-4 存在显著的位置偏差和长度偏好,且与人类标注的相关性在编码任务中较低。
推荐理由:通过对比人类标注与GPT-4评估结果,揭示了LLM评估中的位置偏差与长度偏好问题。
Hugging Face 发布图解文章,详细拆解了人类反馈强化学习(RLHF)的三个核心步骤:预训练语言模型、基于人类偏好训练奖励模型、以及使用 PPO 进行强化学习微调。文章还介绍了 TRL、TRLX 和 RL4LMs 等开源工具,并探讨了 RLHF 在数据成本和算法优化方面的局限性。
推荐理由:原文拆解了RLHF三步流程与开源工具,为理解ChatGPT背后的技术提供了清晰的入门路径。
OpenAI 发布 InstructGPT 模型,通过人类反馈对齐技术显著提升了指令遵循能力,并使其更真实、减少毒性。该模型现已作为默认语言模型部署在 OpenAI API 上。
推荐理由:InstructGPT 通过人类反馈对齐技术提升了指令遵循能力,并作为默认模型上线 API。