跳到正文
原文
OpenAI News·· 2026-03-10AI 评分37

前沿大语言模型中指令层级的改进

Improving instruction hierarchy in frontier LLMs

AI 导读

OpenAI 发布 IH-Challenge 以训练前沿大语言模型优先遵循可信指令,从而提升指令层级、安全可控性及对提示注入攻击的抵抗力。该挑战旨在通过强化模型对指令的优先级判断能力,优化其在复杂交互中的行为表现。

来源:OpenAI News · openai.com