跳到正文

全部动态

今日 6 条
12月23日周一
12月20日周五
  1. Hugging Face Blog73

    Big Bench Audio 发布:语音推理性能显著落后于文本

    Artificial Analysis 发布 Big Bench Audio 数据集,评估语音语言模型的推理能力。测试显示 GPT-4o 在语音到语音任务中准确率仅为 66%,远低于文本处理的 92%,传统语音转文本再转语音的流水线方案在推理准确性上目前优于原生语音模型。

    推荐理由:首次量化语音推理性能衰减,揭示原生语音模型在复杂推理任务中显著落后于文本处理。

12月19日周四
12月18日周三
  1. Hugging Face Blog74

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学等联合发布 Bamba-9B 混合 Mamba2 模型,在 vLLM 中推理吞吐量提升 2.5 倍、延迟降低 2 倍。该模型基于 2.2T token 开源数据训练,性能接近 Llama 3.1 8B,并开源了完整训练代码与数据加载器。

    推荐理由:Bamba-9B 验证了混合 Mamba2 架构在推理效率上的优势,为突破 KV-cache 瓶颈提供了可复现的开源方案。

12月17日周二
  1. Hugging Face Blog72

    TII 发布 Falcon 3 系列开源大模型

    TII 发布 Falcon 3 系列开源大模型,包含 1B、3B、7B、10B 参数 Transformer 模型及 7B Mamba 模型。Falcon3-10B-Base 在 13B 以下模型中表现最佳,数学和代码能力显著提升。所有模型均开源,并支持 GGUF、GPTQ 等格式。

    推荐理由:TII 发布 1B 至 10B 参数模型,在数学和代码推理上表现突出,为端侧部署提供高效选择。

12月16日周一
  1. Hugging Face Blog72

    Hugging Face 发布合成数据生成器,支持零代码构建数据集与微调模型

    Hugging Face 发布合成数据生成器,用户可通过自然语言描述零代码生成文本分类和对话数据集,并支持使用 AutoTrain 直接微调模型。工具基于 distilabel 和 Hugging Face API,提供网页应用、私有部署及 Apache 2.0 开源代码。

    推荐理由:Hugging Face 推出零代码合成数据生成器,打通从自然语言描述到模型微调的完整工作流。

12月13日周五
12月10日周二
12月9日周一
  1. OpenAI News92

    OpenAI 发布视频生成模型 Sora

    OpenAI 宣布视频生成模型 Sora 正式开放使用,用户可通过 sora.com 生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形比例,并允许导入自有素材进行扩展、混剪或从文本生成全新内容。

    推荐理由:Sora 正式开放使用,支持生成 1080p 视频,用户可自定义比例并导入素材进行混剪。

  2. Hugging Face Blog68

    Hugging Face 发布文本到图像生成开源偏好数据集

    Hugging Face 社区发布了面向文本到图像生成的开源偏好数据集,包含 1 万对偏好样本,涵盖多种图像风格与提示词复杂度。数据集采用 Apache 2.0 协议,附带用于数据预处理和后处理的代码,并提供了基于 FLUX.1-dev 模型的 LoRA 微调适配器。

    推荐理由:开源了文本到图像生成的偏好数据集及微调代码,为社区提供了可复用的训练素材。

  3. OpenAI News20

    Sora System Card

    OpenAI 发布 Sora System Card,介绍其视频生成模型 Sora。该模型支持文本、图像和视频输入,可生成新视频。Sora 基于 DALL-E 和 GPT 模型的学习成果,旨在为用户提供更丰富的故事讲述和创意表达工具。

12月5日周四
  1. Hugging Face Blog79

    Google 发布 PaliGemma 2 多模态模型

    Google 发布 PaliGemma 2 视觉语言模型,基于 SigLIP 和 Gemma 2 架构,提供 3B、10B 和 28B 三种参数规模,支持 224x224、448x448 和 896x896 多种输入分辨率。模型采用 Gemma 许可协议,支持商业使用与微调,Hugging Face 同步更新了 transformers 集成与 LoRA 微调脚本。

    推荐理由:提供了多尺寸模型与多分辨率支持,并附带微调脚本,便于开发者快速适配视觉语言任务。

12月4日周三
12月3日周二
12月2日周一
  1. Hugging Face Blog68

    Hugging Face发布欧盟AI法案开源开发者合规指南

    Hugging Face发布指南解读欧盟AI法案对开源开发者的合规要求,涵盖有限风险AI系统的披露义务及非系统性风险GPAI模型的训练数据摘要与版权合规,并推荐了平台上的相关工具。

    推荐理由:文章梳理了欧盟AI法案对开源开发者的合规要求,并提供了Hugging Face平台上的实用工具指引。

11月26日周二
  1. Hugging Face Blog32

    Hugging Face 重构 Hub 上传与下载架构

    Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。

  2. Hugging Face Blog75

    Hugging Face 发布 SmolVLM 2B 多模态模型

    Hugging Face 发布 SmolVLM,一款 2B 参数、完全开源的视觉语言模型。该模型采用像素重排策略将视觉信息压缩 9 倍,在同等规模下显存占用最低且推理速度最快。提供 Base、Synthetic 和 Instruct 三个版本,支持本地部署与微调。

    推荐理由:SmolVLM 通过像素重排策略大幅压缩视觉 Token,在同等规模下实现更低的显存占用和更高的推理速度。

11月25日周一
  1. Hugging Face Blog38

    你可能本可以设计出最先进的旋转位置编码

    本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。

11月21日周四
11月20日周三
  1. Hugging Face Blog70

    Hugging Face 开源 LayerSkip 自推测解码方法与模型

    Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。

    推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。

  2. Hugging Face Blog65

    BAAI FlagEval 推出多语言大模型辩论竞技场

    BAAI FlagEval 推出多语言大模型辩论竞技场,支持中英阿韩四语对抗,引入专家与用户双轨评估机制。o1-preview、GPT-4o、Claude-3.5-sonnet 等已参与,实验显示该模式能更显著区分模型推理与逻辑差异。

    推荐理由:平台引入多语言对抗辩论与专家双轨评估,为模型推理能力提供更细粒度的差异化评测。

11月19日周二
  1. OpenAI News13

    Rox 全面押注 OpenAI

    Rox 宣布全面采用 OpenAI 的模型技术。该平台通过结合商业经验与大语言模型专业知识,旨在利用 OpenAI 的模型能力,帮助每一位卖家跻身前 1% 的顶尖行列。

  2. Hugging Face Blog68

    Hugging Face 推出 Judge Arena 平台评测 LLM 评估能力

    Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。平台包含 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 和 Qwen 2.5 等模型,结果显示 GPT-4 Turbo 暂居榜首,Qwen 2.5 7B 和 Llama 3.1 8B 等小模型表现优异。

    推荐理由:Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。

11月18日周一
  1. Mistral AI70

    Mistral le Chat 更新搜索、Canvas 与 Agent 功能

    Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。

    推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。

  2. Mistral AI85

    Mistral 发布 Pixtral Large 多模态模型并更新 Mistral Large

    Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。

    推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。