OpenAI News·2024-07-24 17:00· 2024-07-24AI 评分33OpenAI 利用基于规则的奖励提升模型安全行为Improving Model Safety Behavior with Rule-Based RewardsAI 导读OpenAI 开发并应用了基于规则的奖励(RBRs)新方法,使模型无需大量人工数据收集即可对齐安全行为。该方法通过规则化奖励机制优化模型表现,提升了模型的安全性。来源:OpenAI News · openai.com#模型发布#安全/对齐#OpenAI