OpenAI News·· 2024-04-20AI 评分33
指令层级:训练大语言模型优先执行特权指令
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
AI 导读
OpenAI 发布“指令层级”方法,训练大语言模型优先执行特权指令,以抵御提示注入和越狱等攻击。该技术旨在解决当前模型易受恶意提示覆盖原始指令的安全隐患,提升模型在对抗环境下的指令遵循能力。
来源:OpenAI News · openai.com