跳到正文
原文
Hugging Face Blog·· 2024-01-26AI 评分40

AI Secure LLM Safety Leaderboard 发布

An Introduction to AI Secure LLM Safety Leaderboard

AI 导读

Hugging Face 发布 AI Secure LLM Safety Leaderboard,基于 DecodingTrust 框架评估大语言模型安全性。该榜单涵盖毒性、偏见、对抗鲁棒性、隐私、伦理和公平性等维度,提供红队测试算法与详细报告。研究发现 GPT-4 比 GPT-3.5 更易受攻击,且无单一模型在所有维度均占优。

来源:Hugging Face Blog · huggingface.co