跳到正文
原文
Hugging Face Blog·· 2024-02-23AI 评分38

Haize Labs 发布红队测试基准 Red Teaming Resistance Benchmark

Introducing the Red-Teaming Resistance Leaderboard

AI 导读

Haize Labs 联合 Hugging Face 发布红队测试基准 Red Teaming Resistance Benchmark,旨在评估前沿大语言模型在极端红队攻击下的鲁棒性。该基准通过 AdvBench、AART 等高质量人类攻击数据集,对模型进行压力测试,并依据 OpenAI 使用政策将违规行为细分为暴力、仇恨、欺诈等具体类别。最终得分以模型判定为“安全”的提示词百分比衡量。

来源:Hugging Face Blog · huggingface.co