跳到正文

全部动态

今日 48 条
9月26日周四
9月25日周三
  1. Hugging Face Blog92

    Hugging Face 发布 Llama 3.2 多模态与端侧模型

    Hugging Face 发布 Llama 3.2,包含 11B 和 90B 视觉模型及 1B 和 3B 端侧文本模型。视觉模型支持 128k 上下文与链式推理,端侧模型支持工具调用与离线运行。欧盟用户被限制使用多模态模型。

    推荐理由:Meta 发布多模态与端侧模型,提供从消费级到生产级的部署方案与基准数据。

9月24日周二
9月23日周一
  1. Hugging Face Blog17

    Hugging Face Daily Papers 页面隐藏功能指南

    Hugging Face 推出 Daily Papers 页面,已收录超 3,700 篇论文并拥有超 12k 订阅者。作者可一键认领论文以关联账号,用户可通过评论 @username 与作者实时互动,并在评论区输入 @librarian-bot 获取相关论文推荐。页面支持多语言评论及内置翻译,并集成 arXiv 扩展功能以快速跳转至 Hugging Face 论文页或 Spaces 演示。

  2. Hugging Face Blog68

    Hugging Face 发布 FineVideo 数据集及构建管线

    Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。

    推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。

9月20日周五
9月19日周四
  1. OpenAI News15

    Genmab 采用 ChatGPT Enterprise

    制药公司 Genmab 正式采用 ChatGPT Enterprise,以利用 OpenAI 在安全和隐私方面的承诺。此举标志着 Genmab 将企业级 AI 工具整合至其工作流程中,旨在通过受控的 AI 环境提升运营效率并保障数据合规性。

9月18日周三
9月17日周二
  1. Mistral AI85

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。

    推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。

  2. Hugging Face Blog70

    Hugging Face 推出数据集 SQL Console 功能

    Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。

    推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。

9月16日周一
  1. Hugging Face Blog65

    HuggingChat 发布社区工具功能

    HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。

    推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。

9月13日周五
9月12日周四
9月5日周四
9月4日周三
8月27日周二
8月26日周一
8月22日周四
8月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 DataCollatorWithFlattening 实现 Flash Attention 2 无填充训练

    Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。

    推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。

8月20日周二
8月19日周一
8月15日周四
8月14日周三
8月13日周二
  1. Hugging Face Blog30

    ggml 入门指南

    ggml 是一个专注于 Transformer 推理的 C/C++ 开源机器学习库,具有极简、轻量且兼容性好的特点。该库核心代码少于 5 个文件,编译后二进制体积小于 1MB,支持量化张量以节省内存。本文面向开发者介绍 ggml 的基础概念、编译方法及核心 API 使用,涵盖上下文、计算图及后端接口等关键术语。

8月12日周一
  1. Hugging Face Blog73

    Hugging Face 推出统一工具调用 API 与工程实践

    Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。

    推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。

  2. Hugging Face Blog70

    TII 发布 Falcon Mamba 7B 纯 Mamba 架构模型

    TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。

    推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。

8月8日周四