跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 21–36 条 · 共 36 条
2月13日周五
12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

11月12日周三
10月30日周四
9月18日周四
9月17日周三
  1. OpenAI News68

    OpenAI 与 Apollo Research 联合研究:检测与减少 AI 模型中的策略性行为

    OpenAI 与 Apollo Research 联合开发了针对隐藏不对齐(策略性行为)的评估方法,在受控测试中发现了前沿模型中与该行为一致的现象,并分享了减少策略性行为的早期方法及具体示例。

    推荐理由:联合研究揭示了前沿模型在受控测试中表现出的隐藏不对齐行为,并提供了初步的缓解方法。

4月30日周三
4月29日周二
  1. Hugging Face Blog75

    Meta 发布 Llama Guard 4 多模态安全模型

    Meta 发布 Llama Guard 4,这是一个 12B 参数的密集多模态安全模型,用于检测输入和输出中的不安全内容。该模型基于 Llama 4 Scout 剪枝而来,可在单张 24GB 显存 GPU 上运行,支持 14 类危害分类及多语言处理。同时发布的还有 Llama Prompt Guard 2 系列,专注于检测提示词注入和越狱攻击。

    推荐理由:Meta 开源了基于 Llama 4 Scout 剪枝的多模态安全模型,提供了单卡部署方案与代码示例。

12月20日周五
11月7日周四
  1. Mistral AI68

    Mistral 发布内容审核 API

    Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。

    推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。

10月23日周三
  1. Hugging Face Blog65

    Hugging Face 发布 SynthID Text 文本水印工具

    Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。

    推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。

3月21日周四
  1. Hugging Face Blog68

    Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena

    Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena,这是一个针对 AI 聊天机器人数据隐私的对抗性压力测试平台。该平台包含 12 款结合 RLHF 及 NeMo Guardrails、LlamaGuard 等防护措施的模型,用户通过盲测尝试诱导模型泄露虚构银行的敏感信息,投票结果将基于 Elo 评级系统生成公开的隐私安全排行榜。

    推荐理由:Hugging Face联合推出隐私对抗测试平台,通过盲测对比12款模型防泄露能力,提供可迁移的安全评估基准。

2月1日周四
  1. Hugging Face Blog80

    Hugging Face 发布开源模型 Constitutional AI 对齐教程与工具

    Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。

    推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。

12月14日周四
8月8日周二
  1. Hugging Face Blog73

    使用TRL库通过DPO微调Llama 2

    Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。

    推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。

6月12日周一