Hugging Face Blog·· 2025-08-01AI 评分30
3LM:面向阿拉伯语大语言模型的 STEM 与代码基准测试
📚 3LM: A Benchmark for Arabic LLMs in STEM and Code
AI 导读
Hugging Face 发布 3LM 基准测试,专门评估阿拉伯语大语言模型在 STEM 学科和代码生成领域的表现。该基准包含 865 道原生 STEM 选择题、1,744 道合成高难度题目及基于 HumanEval+ 和 MBPP+ 翻译的代码任务。测试显示 Qwen2.5-72B-Instruct 在 STEM 选择题中表现最佳,GPT-4o 在代码生成任务中得分最高。
来源:Hugging Face Blog · huggingface.co