跳到正文
原文
Hugging Face Blog·· 2025-08-01AI 评分30

3LM:面向阿拉伯语大语言模型的 STEM 与代码基准测试

📚 3LM: A Benchmark for Arabic LLMs in STEM and Code

AI 导读

Hugging Face 发布 3LM 基准测试,专门评估阿拉伯语大语言模型在 STEM 学科和代码生成领域的表现。该基准包含 865 道原生 STEM 选择题、1,744 道合成高难度题目及基于 HumanEval+ 和 MBPP+ 翻译的代码任务。测试显示 Qwen2.5-72B-Instruct 在 STEM 选择题中表现最佳,GPT-4o 在代码生成任务中得分最高。

来源:Hugging Face Blog · huggingface.co