跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 41–51 条 · 共 51 条
12月20日周五
11月7日周四
  1. Mistral AI68

    Mistral 发布内容审核 API

    Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。

    推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。

10月23日周三
  1. Hugging Face Blog65

    Hugging Face 发布 SynthID Text 文本水印工具

    Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。

    推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。

3月21日周四
  1. Hugging Face Blog68

    Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena

    Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena,这是一个针对 AI 聊天机器人数据隐私的对抗性压力测试平台。该平台包含 12 款结合 RLHF 及 NeMo Guardrails、LlamaGuard 等防护措施的模型,用户通过盲测尝试诱导模型泄露虚构银行的敏感信息,投票结果将基于 Elo 评级系统生成公开的隐私安全排行榜。

    推荐理由:Hugging Face联合推出隐私对抗测试平台,通过盲测对比12款模型防泄露能力,提供可迁移的安全评估基准。

2月1日周四
  1. Hugging Face Blog80

    Hugging Face 发布开源模型 Constitutional AI 对齐教程与工具

    Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。

    推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。

1月18日周四
  1. Hugging Face Blog67

    Hugging Face 实测对比 DPO、IPO、KTO 三种大模型偏好对齐算法

    Hugging Face 在 alignment-handbook 中实测对比了 DPO、IPO 和 KTO 三种无需强化学习的偏好对齐算法。实验基于 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 模型,使用 MT-Bench 评估发现 DPO 在成对偏好设置中表现最佳,且对超参数 beta 的敏感性因基座模型而异。

    推荐理由:通过MT-Bench实测对比DPO、IPO、KTO三种对齐算法,揭示了超参数敏感性并给出最佳实践参考。

12月14日周四
8月8日周二
  1. Hugging Face Blog73

    使用TRL库通过DPO微调Llama 2

    Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。

    推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。

6月12日周一
12月9日周五
  1. Hugging Face Blog65

    图解人类反馈强化学习(RLHF)

    Hugging Face 发布图解文章,详细拆解了人类反馈强化学习(RLHF)的三个核心步骤:预训练语言模型、基于人类偏好训练奖励模型、以及使用 PPO 进行强化学习微调。文章还介绍了 TRL、TRLX 和 RL4LMs 等开源工具,并探讨了 RLHF 在数据成本和算法优化方面的局限性。

    推荐理由:原文拆解了RLHF三步流程与开源工具,为理解ChatGPT背后的技术提供了清晰的入门路径。

1月27日周四
  1. OpenAI News93

    OpenAI 发布 InstructGPT 模型并上线 API

    OpenAI 发布 InstructGPT 模型,通过人类反馈对齐技术显著提升了指令遵循能力,并使其更真实、减少毒性。该模型现已作为默认语言模型部署在 OpenAI API 上。

    推荐理由:InstructGPT 通过人类反馈对齐技术提升了指令遵循能力,并作为默认模型上线 API。