跳到正文

#Hugging Face

今日 0 条
9月14日周二
  1. Hugging Face Blog66

    Hugging Face 发布 Optimum 模型优化库

    Hugging Face 发布开源库 Optimum,旨在降低 Transformer 模型在生产环境中的部署难度。该库联合硬件合作伙伴(如 Intel)提供模型量化与加速工具,通过 Neural Compressor 等方案实现高效推理。

    推荐理由:Hugging Face 联合 Intel 发布 Optimum 库,提供开箱即用的模型量化与加速方案,降低生产环境部署门槛。

7月15日周四
7月13日周二
  1. Hugging Face Blog31

    spaCy 正式接入 Hugging Face Hub

    spaCy 正式接入 Hugging Face Hub,用户可通过一条命令上传模型包并自动生成模型卡片与元数据。Hub 上已收录 60 余个来自 spaCy 3.1 版本的官方模型,支持开箱即用的 NER 推理 API 及浏览器内交互式测试。集成库 huggingface-hub 扩展了 CLI 命令,方便开发者将模型一键发布至 Hub 供社区共享。

7月8日周四
6月28日周一
5月25日周二
4月20日周二
4月16日周五
  1. Hugging Face Blog66

    Hugging Face 发布 Accelerate 库简化 PyTorch 分布式训练

    Hugging Face 发布 Accelerate 库,通过极简 API 封装分布式训练脚本添加少量代码即可适配多 GPU、TPU 及混合精度训练。该库自动处理设备放置、数据采样同步及梯度聚合,并提供 CLI 启动器简化配置流程。

    推荐理由:通过极简 API 封装分布式训练样板代码,使 PyTorch 原生脚本无缝适配多卡与混合精度。

4月8日周四
3月31日周三
  1. Hugging Face Blog35

    理解 BigBird 的块稀疏注意力机制

    BigBird 采用块稀疏注意力机制替代 BERT 的全注意力,将序列处理长度提升至 4096 并大幅降低计算成本。该模型通过局部滑动窗口、全局 token 和随机 token 三种策略实现高效长序列处理,在长文档摘要和长上下文问答任务中达到 SOTA 水平。目前 BigBird RoBERTa-like 模型已集成至 Hugging Face Transformers 库。

3月23日周二
3月18日周四
3月12日周五
2月25日周四
2月10日周三
2月9日周二
  1. Hugging Face Blog35

    Hugging Face 与 PyTorch / XLA 合作实现 Cloud TPU 上的 Transformer 训练支持

    Hugging Face 与 PyTorch / XLA 团队合作,在 Hugging Face 库中新增对 Cloud TPUs 的训练支持。该集成允许 PyTorch 用户通过 Trainer 模块使用相同的接口在 Cloud TPUs 上运行和扩展模型。文章介绍了 XLA:TPU 设备类型、训练步骤计算、输入管道优化以及检查点写入加载等关键实现细节。

1月26日周二
1月19日周二
1月18日周一
  1. Hugging Face Blog32

    Hugging Face 如何为 API 客户将 Transformer 推理速度提升 100 倍

    Hugging Face 通过底层优化将 Transformer 推理速度提升 100 倍,以支持 🤗 API 客户。首先利用 🤗 Transformers 和 🤗 Tokenizers 库的高效方法实现 10 倍加速,随后针对特定硬件进行图优化、层融合和量化,再获 10 倍提升。该加速方案帮助机器学习工程师在实时应用中降低延迟。

11月9日周一
11月3日周二
11月2日周一
  1. Hugging Face Blog17

    Transformers 3.1 集成 Ray Tune 实现超参数搜索

    Hugging Face Transformers 3.1 版本与 Ray Tune 集成,提供简单的超参数调优方案。实验显示,在 RTE 数据集上,基于种群训练(PBT)的优化方法将最佳验证准确率提升至 78%,测试准确率达 70.5%。该集成支持通过 `trainer.hyperparameter_search` 调用多种算法,并默认利用 CPU 或 GPU 资源。

10月10日周六
  1. Hugging Face Blog15

    Transformer 编码器-解码器模型详解

    Hugging Face 发布博文详解 Transformer 编码器-解码器架构,涵盖 T5、Bart、MarianMT 和 Pegasus 等模型在推理阶段的应用。文章从序列到序列任务背景出发,深入解析编码器与解码器的数学原理及实现细节,旨在建立理论与 🤗Transformers 库实践之间的联系。

9月10日周四
7月3日周五
  1. Hugging Face Blog38

    Reformer:突破语言建模极限

    Reformer 模型可将内存占用控制在 8GB 以下,支持单次处理长达 50 万 token 的序列。该模型通过局部自注意力、分块前馈层、可逆残差层和轴向位置编码四大特性优化 Transformer 架构,显著降低长序列建模的显存需求。

3月1日周日
2月14日周五