跳到正文
原文
OpenAI News·· 2024-04-20AI 评分33

指令层级:训练大语言模型优先执行特权指令

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

AI 导读

OpenAI 发布“指令层级”方法,训练大语言模型优先执行特权指令,以抵御提示注入和越狱等攻击。该技术旨在解决当前模型易受恶意提示覆盖原始指令的安全隐患,提升模型在对抗环境下的指令遵循能力。

来源:OpenAI News · openai.com