OpenAI News·2025-12-03 18:00· 2025-12-03AI 评分32OpenAI 研究如何通过“忏悔”机制让大语言模型保持诚实How confessions can keep language models honestAI 导读OpenAI 研究人员正在测试一种名为“confessions”的方法,旨在训练模型在犯错或行为不当时主动承认。该机制有助于提升人工智能的诚实度、透明度以及对模型输出的信任感。来源:OpenAI News · openai.com#安全/对齐#推理#OpenAI