Hugging Face 发布 2023 年实习生招聘计划
Hugging Face 宣布启动 2023 年实习生项目,提供 Accelerate、Text to Speech、Embodied AI 等多个岗位。申请者需通过 Hugging Face 账号在招聘门户提交申请,项目强调多元化与包容性,鼓励来自不同背景及边缘群体的人才加入。
Hugging Face 宣布启动 2023 年实习生项目,提供 Accelerate、Text to Speech、Embodied AI 等多个岗位。申请者需通过 Hugging Face 账号在招聘门户提交申请,项目强调多元化与包容性,鼓励来自不同背景及边缘群体的人才加入。
本文解析了文档 AI 的六大用例及对应的开源模型方案。LayoutLMv3 在 PubLayNet 基准测试中 mAP 达 0.951,LayoutLM 在 FUNSD 基准上 F1 分数达 90%。文章涵盖 OCR、文档分类、布局分析及解析等任务,指导利用开源模型构建自定义解决方案。
Hugging Face 在 transformers 库中引入了对比搜索(Contrastive Search)解码方法,该方法在 NeurIPS 2022 上提出,旨在生成人类水平的文本。
Hugging Face 宣布停用 Inference API 的付费层级,推荐用户转向新推出的 Inference Endpoints 以获取企业级推理服务。平台同步升级了 Spaces 的硬件选项,用户只需绑定信用卡即可按需选择硬件运行 ML 演示。所有付费服务及 PRO 订阅费用将于每月月初统一结算并提供合并发票。
Hugging Face发布基于Diffusers训练Stable Diffusion的Dreambooth技巧。推荐低学习率(如1e-6)配合较多训练步数(人脸约1200步)以避免过拟合;微调文本编码器可显著提升质量,但需24GB显存;过拟合时改用DDIM调度器并增加推理步数能改善效果。
推荐理由:原文基于大量实验给出了Dreambooth微调Stable Diffusion的具体超参数建议和避坑指南。
Hugging Face 发布指南,演示如何使用 🤗 Transformers 微调 Whisper 模型进行多语言自动语音识别。文章以 244M 参数的 small 检查点为例,利用 Common Voice 数据集在低资源语言上仅需 8 小时微调数据即可实现高性能。
Hugging Face 宣布 Optimum Intel 集成 Intel OpenVINO,支持在 Intel 处理器上对 Transformers 模型进行推理与量化。以 ViT 模型为例,量化后模型体积缩小 3.8 倍,推理延迟降低 2.4 倍。
推荐理由:Hugging Face 官方宣布集成 OpenVINO,提供一键量化与推理工具,可显著降低模型体积与延迟。
Hugging Face 发布 MTEB 大规模文本嵌入模型评测基准,涵盖 56 个数据集和 8 个任务,支持 112 种语言。该基准提供排行榜和 Python 库,用户可便捷地对模型进行基准测试并提交结果。
推荐理由:MTEB 提供了涵盖多语言和多任务的文本嵌入模型统一评测框架,方便开发者快速选型。
Hugging Face 发布 Inference Endpoints,允许用户通过几步操作将模型从 Hub 直接部署到 AWS 等云厂商的托管基础设施。服务支持 Public、Protected 和 Private 三种安全模式,其中 Private 模式可通过 AWS PrivateLink 实现 VPC 内网访问,并提供自动扩缩容、监控日志和 API 调用能力。
推荐理由:官方发布托管推理服务,提供从公开到私有VPC的多级安全部署选项,降低生产环境部署门槛。
Hugging Face 团队通过优化 BLOOM 推理服务器,实现了 5 倍延迟降低和 50 倍吞吐量提升。该过程涉及将基于 Megatron-Deepspeed 训练的 176B 参数模型移植到 transformers 库,并利用 Accelerate 进行分布式部署。
Hugging Face 宣布用户可直接在 Hub 为模型和数据集生成 DOI。该功能与 DataCite 合作实现,DOI 绑定元数据并提供永久链接,便于学术引用。新版本发布时 DOI 可更新,旧版本 DOI 失效。
rinna 发布基于 Stable Diffusion 微调的日语专用模型 Japanese Stable Diffusion,支持日语提示词并生成反映日本文化的图像。
Hugging Face 推出 Hub 零样本评估功能,支持无需编写代码即可对模型进行零样本分类评估。该功能基于 AutoTrain 构建,目前支持最高 660 亿参数模型,评估 660 亿参数模型需 3.5 小时。
Hugging Face AutoTrain 新增图像分类任务,支持零配置训练模型。用户只需上传数据并选择任务,AutoTrain 会自动尝试多个模型架构以寻找最佳方案。例如使用蝴蝶数据集训练时,最佳模型准确率达 84%,且训练 5 个候选模型且数据少于 500 张时免费。
Hugging Face 详解 Accelerate 如何利用 PyTorch meta device 和分片加载技术,在有限 RAM 和 GPU 的硬件上运行 OPT-6.7B 等超大模型。
推荐理由:详解利用meta device与分片加载在消费级硬件运行超大模型的技术路径。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一种用于 Sentence Transformers 的高效少样本微调框架。
推荐理由:Hugging Face 发布 SetFit 框架,通过两阶段微调实现无需提示词的高效少样本学习,并附完整代码教程。
Hugging Face 发布首期 Ethics and Society Newsletter,阐述其以协作、责任和透明为核心的伦理价值观。该平台通过提供文档与评估工具、建立 Discord 社区讨论机制以及推出 Private Hub 和代码审查功能,致力于提升机器学习系统的可审计性与透明度。
本文展示了如何利用 DeepSpeed-Inference 和 HuggingFace Accelerate 在 8x80GB A100 节点上实现 176B 参数 BLOOM 模型的极速推理。
Hugging Face 发布 Diffusers 0.3,新增图生图(Img2Img)和文本反转(Textual Inversion)功能,并推出实验性图像修复(Inpainting)管线。该版本优化了显存占用,仅需 3.2GB 即可运行,并新增对 Mac (M1/M2) 和 ONNX 硬件的支持。
Hugging Face 发布教程,指导用户利用 transformers 库从零开始训练离线 Decision Transformer 模型。该模型基于 GPT-2 架构,通过序列建模替代传统强化学习,在 Gym HalfCheetah 环境中根据期望回报生成动作。教程提供了包含数据预处理和自定义 Data Collator 的完整代码实现。
Hugging Face 支持推出 OpenRAIL 许可框架,旨在为 AI 模型提供开放访问与负责任使用的平衡机制。该框架允许免费获取和分发模型,同时嵌入基于证据的使用限制条款,禁止在特定关键场景下使用,以应对开源许可在伦理和社会经济层面的不足。
本文介绍如何在 Hugging Face Spaces 中利用 3Dmol.js 和 Gradio 的 HTML 组件实现蛋白质结构的浏览器端可视化。通过构建最小化演示应用,用户可输入 4 位 PDB 代码或上传 PDB 文件,应用将从 RCSB Protein Databank 检索数据并渲染 3D 结构。
Hugging Face发布教程,演示如何使用Diffusers库运行Stable Diffusion模型生成图像,并深入解析了VAE、U-Net和Text-Encoder等核心组件的推理流程。
推荐理由:文章提供了基于Diffusers库的Stable Diffusion实操代码,并详细解析了VAE、U-Net等核心组件的推理流程。
本教程演示了如何在 AWS DL1 实例上利用 Habana Gaudi 硬件,通过 Hugging Face Transformers、Optimum Habana 和 Datasets 库从零预训练 BERT-base 模型。
本文介绍如何在 Vertex AI 平台上部署基于 TensorFlow 的 Vision Transformers (ViT) 模型。通过 Google Cloud Storage 存储模型工件,利用 Vertex AI Model Registry 管理模型版本,并使用 Endpoint 接收预测请求。
Hugging Face Optimum Graphcore 库支持在 Graphcore IPUs 上高效微调 Vision Transformers (ViT)。该库提供预训练模型检查点,结合 IPU 的并行架构加速训练,显著缩短开发周期。文章以 ChestX-ray14 数据集为例,演示了 ViT 在医疗影像分类中的应用流程。
Hugging Face 将 LLM.int8() 8-bit 量化技术集成至 transformers 和 accelerate 库,使 BLOOM-176B 等超大模型显存占用减半且性能无退化。该方案通过分离异常值计算,在 Turing 和 Ampere 架构 GPU 上实现高效推理。
推荐理由:官方将LLM.int8()集成至transformers库,提供降低显存占用且保持性能的方法与代码示例。
Hugging Face 发布 Skops 库,用于将 scikit-learn 模型安全托管在 Hugging Face Hub 并生成模型文档。该工具利用 joblib 序列化模型,自动提取超参数、交互式图表及评估指标填充模型卡片。用户可通过配置任务类型和数据集,在 Hub 页面启用推理组件以提升模型发现能力。
Hugging Face 阐述其 TensorFlow 库的设计哲学,主张所有 TensorFlow 模型和层均应为 Keras 对象,以便直接调用 fit、compile 和 predict 等方法。文章介绍了通过 TFAutoModel 和 AutoTokenizer 加载预训练模型及分词器进行迁移学习的流程,强调输入处理需与训练时保持一致。
本文介绍如何利用 Docker 和 Kubernetes 将 Vision Transformer (ViT) 模型从本地部署扩展至生产环境。通过构建基于 TensorFlow Serving 的 Docker 镜像,并部署到 Google Kubernetes Engine (GKE) 集群,实现模型的可扩展性与高可用性。
Sentence Transformers 模型通过 Transformer 编码器和 Pooling 层将变长文本映射为固定长度嵌入向量。该指南介绍了如何从零构建模型或微调 Hugging Face Hub 上的现有模型,重点讲解了数据集格式与损失函数的选择。
Proximal Policy Optimization (PPO) 通过限制策略更新幅度来提升训练稳定性,避免过大更新导致模型崩溃。该方法使用当前与旧策略的概率比率,并将其裁剪在 [1−ϵ,1+ϵ] 范围内,从而约束策略变化。文章随后使用 PyTorch 从零实现 PPO 架构,并在 CartPole-v1 和 LunarLander-v2 环境中进行验证。
Hugging Face 推出 Private Hub,旨在为机器学习提供统一且安全的开发工具。该平台整合了 Hub 上的 6 万多个模型、6000 多个数据集和 6000 多个应用,支持通过 Git 进行版本控制与协作。
Nyströmformer 利用 Nyström 方法近似自注意力,将时间和内存复杂度从 O(n^2) 降低至 O(n)。该方法通过选取 32 或 64 个 landmarks 构建矩阵,避免计算 QK^T 乘积,在长序列(如 4096 或 8192)上保持竞争力。Hugging Face 已提供该模型的实现代码。
Hugging Face 向白宫科技政策办公室提交关于实施国家人工智能研究资源(NAIRR)中期报告的建议。建议包括任命技术与伦理专家担任顾问、采用 Model Cards 等文档标准、通过 AutoTrain 等工具降低非技术专家门槛,以及建立开源资源滥用监控机制。
Hugging Face 更新了 🤗 Datasets 库的文档,新增针对音频和图像数据集的加载与处理指南。Quickstart 增加了端到端示例,并引入 to_tf_dataset 函数以简化 TensorFlow 数据转换。同时推出的 ImageFolder 功能支持通过文件夹结构直接加载图像数据集,并可结合元数据文件处理目标检测等任务。
Hugging Face 团队展示了如何使用 TensorFlow Serving 在本地部署 TensorFlow 视觉模型,将模型暴露为 REST 或 gRPC 端点。文章以 Vision Transformer 为例,演示了通过 save_pretrained 将模型保存为 SavedModel 格式,并详细说明了如何将图像预处理和后处理逻辑嵌入计算图以优化部署流程。
Hugging Face 深度强化学习课程介绍 Actor-Critic 方法,通过结合策略与价值函数降低方差。Advantage Actor Critic (A2C) 利用 Critic 评估动作优劣,辅助 Actor 更新策略,从而提升训练稳定性与效率。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足行走器和蜘蛛机器人。
动态对抗数据收集(DADC)通过让人类用户生成对抗样本来欺骗模型,从而克服静态基准测试的局限。以 MNIST 手写数字识别为例,利用 Hugging Face Spaces 构建交互界面,收集用户绘制的难例并重新训练模型。该过程通过多轮迭代,显著提升模型的鲁棒性与泛化能力。
本文解析了 176B 参数多语言模型 BLOOM 的训练技术。该模型基于 GPT3 架构,使用 384 块 80GB A100 GPU 在 Jean Zay 超算上训练 3.5 个月完成。核心技术为 Megatron-DeepSpeed 实现的 3D 并行,结合 ZeRO、流水线并行和张量并行。