Hugging Face Blog·· 2024-11-19精选AI 评分68
Hugging Face 推出 Judge Arena 平台评测 LLM 评估能力
Judge Arena: Benchmarking LLMs as Evaluators
AI 导读
Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。平台包含 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 和 Qwen 2.5 等模型,结果显示 GPT-4 Turbo 暂居榜首,Qwen 2.5 7B 和 Llama 3.1 8B 等小模型表现优异。
推荐理由
Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。
来源:Hugging Face Blog · huggingface.co