跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 21–26 条 · 共 26 条
11月19日周二
  1. Hugging Face Blog68

    Hugging Face 推出 Judge Arena 平台评测 LLM 评估能力

    Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。平台包含 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 和 Qwen 2.5 等模型,结果显示 GPT-4 Turbo 暂居榜首,Qwen 2.5 7B 和 Llama 3.1 8B 等小模型表现优异。

    推荐理由:Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。

6月18日周二
1月18日周四
  1. Hugging Face Blog67

    Hugging Face 实测对比 DPO、IPO、KTO 三种大模型偏好对齐算法

    Hugging Face 在 alignment-handbook 中实测对比了 DPO、IPO 和 KTO 三种无需强化学习的偏好对齐算法。实验基于 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 模型,使用 MT-Bench 评估发现 DPO 在成对偏好设置中表现最佳,且对超参数 beta 的敏感性因基座模型而异。

    推荐理由:通过MT-Bench实测对比DPO、IPO、KTO三种对齐算法,揭示了超参数敏感性并给出最佳实践参考。

6月23日周五
  1. Hugging Face Blog70

    Open LLM Leaderboard MMLU 评估差异解析

    Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。

    推荐理由:原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。

6月12日周一
10月19日周三
  1. Hugging Face Blog68

    Hugging Face 发布 MTEB 文本嵌入模型大规模评测基准

    Hugging Face 发布 MTEB 大规模文本嵌入模型评测基准,涵盖 56 个数据集和 8 个任务,支持 112 种语言。该基准提供排行榜和 Python 库,用户可便捷地对模型进行基准测试并提交结果。

    推荐理由:MTEB 提供了涵盖多语言和多任务的文本嵌入模型统一评测框架,方便开发者快速选型。