跳到正文

全部动态

今日 48 条
5月16日周四
5月15日周三
5月14日周二
  1. Hugging Face Blog25

    发布 Open Arabic LLM Leaderboard

    Open Arabic LLM Leaderboard (OALL) 正式上线,旨在评估和比较阿拉伯语大语言模型的性能。该榜单利用 AlGhafa、ACVA 和 AceGPT 等数据集,采用标准化对数似然准确率作为核心评估指标。技术架构基于 lighteval 库,并支持社区提交模型参与排名。

  2. Hugging Face Blog83

    Google 发布开源视觉语言模型 PaliGemma

    Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。

    推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。

5月13日周一
  1. Hugging Face Blog78

    Hugging Face 发布独立 Agent 库 smolagents,开源模型 GAIA 基准超越 GPT-4

    Hugging Face 将 Transformers Agents 升级为独立库 smolagents,引入支持基于过往观察进行迭代的 ReactAgent 新架构。使用 Llama-3-70B-Instruct 驱动的多模态 Agent 在 GAIA 基准测试中排名第四,超越了多个基于 GPT-4 的 Agent。

    推荐理由:Hugging Face 发布独立 Agent 库,提供可迭代的新架构,开源模型在 GAIA 基准上表现超越 GPT-4。

5月9日周四
5月7日周二
5月6日周一
5月5日周日
  1. Hugging Face Blog30

    Hugging Face 推出希伯来语 LLM 开放排行榜

    Hugging Face 推出专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评估空白。该榜单包含希伯来语问答、情感准确性、Winograd Schema 挑战及翻译四项基准测试,采用 few-shot 提示格式评估模型。模型通过 HuggingFace Inference Endpoints 自动部署,由 lighteval 库管理 API 请求进行评测。

5月3日周五
5月1日周三
  1. Hugging Face Blog68

    在 Hugging Face Inference Endpoints 上部署带说话人分离和推测解码的 ASR 服务

    Hugging Face 博客发布教程,展示如何通过自定义推理处理器在 Inference Endpoints 上部署模块化语音识别服务。该方案结合 OpenAI Whisper 与 Pyannote 模型实现说话人分离,并引入推测解码加速推理。基准测试显示,在短音频且 batch size 为 1 时,推测解码可带来显著性能提升。

    推荐理由:提供了结合 Whisper 与 Pyannote 的完整代码,展示了如何在 Inference Endpoints 上部署带说话人分离和推测解码的语音识别服务。

4月30日周二
4月29日周一
  1. Hugging Face Blog77

    StarCoder2-15B-Instruct-v0.1 发布:完全透明的自对齐代码模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全透明且许可自由的自对齐管道训练的代码大语言模型。该模型仅使用 StarCoder2-15B 自身生成的指令-响应对进行微调,无需人工标注或闭源模型蒸馏数据。

    推荐理由:模型采用完全自生成的指令微调数据,在编码基准上超越部分闭源模型,提供了可复用的自对齐方法。

4月24日周三
  1. OpenAI News75

    OpenAI 推出 ChatGPT 和 Whisper API

    OpenAI 宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。

    推荐理由:OpenAI 官方宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。

4月23日周二
  1. Hugging Face Blog50

    发布 Open Chain of Thought Leaderboard

    Hugging Face 发布 Open Chain of Thought Leaderboard,通过对比有无思维链提示的准确率差异来评估大语言模型的推理能力。该榜单基于 LogiQA 和 LSAT 数据集,采用 Classic 和 Reflect 两种提示策略生成推理轨迹,旨在更稳健地衡量模型在复杂逻辑任务中的思维链生成效果。

4月22日周一
  1. Hugging Face Blog42

    Jack of All Trades:基于 Transformer 的多用途通用智能体

    Hugging Face 发布 Jack of All Trades (JAT),这是一个基于 Transformer 架构的多用途通用智能体项目。JAT 模型在 Atari 57、BabyAI、Meta-World 和 MuJoCo 等 157 个任务上平均达到专家性能的 65.8%,并在 21 个 Atari 游戏中超越人类水平。该项目同时开源了包含数十万专家轨迹的 JAT 数据集及模型。

4月20日周六
4月19日周五
4月18日周四
  1. Hugging Face Blog92

    Hugging Face 发布 Llama 3 模型及生态集成指南

    Hugging Face 宣布 Meta 开源大模型 Llama 3 正式上架,提供 8B 和 70B 两种参数规模及基础与指令微调版本,并同步发布安全模型 Llama Guard 2。文章详细介绍了 Llama 3 在训练数据、上下文窗口和 Tokenizer 方面的升级,并给出了基于 Transformers 进行推理、量化部署及 TRL 微调的具体代码示例。

    推荐理由:Hugging Face 提供了从模型下载、量化部署到微调的完整技术路径,帮助开发者快速接入 Llama 3。

4月17日周三
  1. Mistral AI85

    Mistral AI 发布 Mixtral 8x22B 开源模型

    Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。

    推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。

4月16日周二
  1. Hugging Face Blog52

    LiveCodeBench 评测基准正式上线

    Hugging Face 上线 LiveCodeBench Leaderboard,基于 UC Berkeley 等机构开发的 LiveCodeBench 基准,提供防污染的时间窗口评测。该基准涵盖代码生成、自我修复、代码执行和测试输出预测四个场景,采用 Pass@1 指标,并支持通过 GitHub 仓库提交模型结果。

  2. Hugging Face Blog38

    使用 Gradio Reload Mode 快速构建 AI 应用

    Gradio 推出 Reload Mode,在修改源码后无需重启服务器即可自动加载最新更改,显著缩短开发迭代周期。该模式通过自定义重载逻辑,避免重新加载大模型或连接数据库带来的延迟,并支持使用 `gr.NO_RELOAD` 标记不重载代码。结合 Hugging Face Inference API,开发者可快速构建文档分析等多模态应用。

4月15日周一