TAPEX:无需真实数据的高效表格预训练方法
TAPEX 通过利用合成 SQL 查询及其执行结果作为预训练数据,实现了无需真实数据的表格预训练。该模型在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准测试中均取得新的 SOTA 结果,并在所有数据集上大幅超越 BART 及此前方法。TAPEX 模型已集成至 🤗 Transformers 4.19.0 并支持交互式演示。
TAPEX 通过利用合成 SQL 查询及其执行结果作为预训练数据,实现了无需真实数据的表格预训练。该模型在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准测试中均取得新的 SOTA 结果,并在所有数据集上大幅超越 BART 及此前方法。TAPEX 模型已集成至 🤗 Transformers 4.19.0 并支持交互式演示。
Hugging Face 发布深度强化学习课程第二部分,详解 Q-Learning 算法原理及从零实现 Q-Learning 智能体。课程涵盖 Q-Table 初始化、Epsilon Greedy 策略及 TD 更新公式,并指导在 Frozen Lake v1 和自动驾驶出租车环境中进行训练。
Hugging Face 多模态学习小组发布伦理宪章,将伦理原则置于机器学习研究生命周期核心。该宪章明确禁止推广暴力、歧视及生成虚假信息等滥用行为,并确立透明、开放、公平及自我批判等价值观。文件注明为 2022 年 5 月的工作进展,旨在通过公开决策接受社区反馈并持续迭代。
Sempre Health 借助 Hugging Face Expert Acceleration Program 部署了新的 NLP 管道,自动处理超过 20% 的入站患者短信。该方案替代了仅覆盖 80% 的规则系统,显著提升了业务可扩展性并减少了运营团队的低价值工作。
Hugging Face 推出深度强化学习免费课程,本文作为第一部分深入讲解基于价值的方法及 Q-Learning 算法。内容涵盖状态价值函数、动作价值函数、贝尔曼方程以及蒙特卡洛与时间差分学习的区别,并介绍从零实现 Q-Learning 智能体。该智能体将在 Frozen-Lake-v1 和出租车导航环境中进行训练,为后续学习 Deep Q-Learning 奠定基础。
Hugging Face 播客邀请机器学习专家 Sasha Luccioni 探讨大语言模型的环境影响。她担任 Big Science Workshop 碳足迹工作组主席,致力于量化模型训练及日常办公(如邮件)的碳排放。Luccioni 还分享了关于数据策展、多语言支持及 AI 伦理的研究与实践。
Hugging Face 宣布推出 Fellowship 项目,旨在支持对机器学习开源生态做出卓越贡献的开发者。该项目通过提供计算资源、官方认可等个性化福利,赋能关键贡献者扩大影响力。首批入选者包括在西班牙语 NLP、模型贡献及 TensorFlow 架构优化等领域表现突出的多位开发者。
Hugging Face 发布 Gradio 3.0,基于 Svelte 重构前端以提升加载速度,并推出低层级 Blocks API 支持构建具有多步骤接口和灵活数据流的复杂自定义 Web 应用。
Hugging Face 开放首个学生大使计划申请,旨在向全球推广开源机器学习。入选者将获得 Hugging Face 团队支持、专属资源及官方认证。申请者需为在校学生,完成过机器学习相关课程,并遵守社区行为准则。
Hugging Face Optimum 1.2 发布推理支持,新增 ORTModel 类与 pipelines API,兼容 Transformers 接口。通过图优化与动态量化,RoBERTa 推理延迟从 117.61ms 降至 64.94ms,模型体积减半且精度保持 99.61%。
Hugging Face 宣布完成由 Lux Capital 领投的 1 亿美元 C 轮融资。该平台已托管 10 万个预训练模型和 1 万个数据集,成为机器学习的核心枢纽。Hugging Face 将利用资金加大在研究、开源产品及负责任 AI 领域的投入,并继续推进 BigScience 等开源大模型项目。
fastai 正式集成至 Hugging Face Hub,用户可通过一行 Python 代码将模型上传至 Hub。该集成支持版本控制与模型卡片自动生成,并允许通过 from_pretrained_fastai 函数直接加载模型。此举旨在降低深度学习门槛,促进开源模型的共享与复用。
Hugging Face 发布教程介绍如何使用 Accelerate 库集成 PyTorch Fully Sharded Data Parallel (FSDP) 训练大模型。实测显示 FSDP 相比 DDP 可将最大批量提升 2-3 倍,并支持 CPU Offload 在单卡运行 1.5B 模型。文章同时指出 FSDP 目前不支持混合精度,并强调需先准备模型再创建优化器以避免参数组丢失。
推荐理由:文章通过 GPT-2 实测对比 DDP 与 FSDP,给出显存节省与批量提升数据,提供可直接复用的配置与代码规范。
HuggingFace AutoTrain 与 Kili 平台结合,构建了用于文本分类的主动学习流水线。AutoTrain 自动化数据清洗、模型选择及超参数优化,支持多标签文本分类等任务。Kili 提供协作式数据标注工具,通过迭代标注与模型重训练,实现对 Google Play Store 中 Medium 应用评论的分类与情感分析。
Hugging Face 博客发布系列文章,邀请多位机器学习总监分享对媒体、制药等行业的见解。Archi Mitra 指出机器学习通过隐私优先的个性化、辅助工具及强化学习优化媒体业务。Li Tan 强调制药领域需确保训练数据中各族群的平等与多样性。
本文介绍了如何在 AWS 上设置 Habana Gaudi 实例并使用 Transformers 微调 BERT 模型。通过运行 GLUE 基准测试中的 MRPC 任务,模型在 2 分 12 秒内完成训练,F1 分数达到 0.9181。利用 Spot Instances 可将每小时成本从 13.11 美元降至 3.93 美元。
本文介绍如何利用 Hugging Face 生态系统中的机器学习工具模拟真实的客户服务用例。文章详细阐述了定义 NLP 任务、筛选数据集以及选择模型的具体步骤,旨在通过自动化技术识别并优先处理极度不满的客户反馈。
Hugging Face 推出教育计划,旨在向全球普及机器学习知识,目标是在 2023 年底前教会 500 万人。该平台提供免费的 NLP 和深度强化学习课程,并允许用户直接在浏览器中试用模型。此外,Hugging Face 还为教育工作者提供多语言免费工具包及协作空间,以支持课堂教学。
Hugging Face 推出工具帮助追踪和报告机器学习模型的 CO2 排放。通过 huggingface_hub 库的 emissions_thresholds 参数,用户可按碳排放量筛选模型。使用 transformers 库配合 codecarbon 集成,可自动记录训练过程中的碳排放数据。
Hugging Face 机器学习工程师 Lewis Tunstall 做客播客,分享其著作《NLP with Transformers》的创作历程及在 Hugging Face 的工作。他重点介绍了通过 ONNX 格式优化模型部署,帮助工程师实现更低延迟和更高吞吐量,并探讨了 Transformers 在 NLP 及 MLOps 领域的应用。
Hugging Face 的 Transformers 库采用单模型文件策略,拒绝 DRY 原则,将每个模型的前向传播代码集中在独立文件中。此举旨在降低开源社区贡献门槛,确保模型代码易于阅读和修改,并适应机器学习领域极快的演进速度。
Hugging Face 将离线强化学习方法 Decision Transformer 集成至 🤗 transformers 库及 Hugging Face Hub。该模型将强化学习抽象为条件序列建模问题,利用 Transformer 根据期望回报、历史状态和动作生成未来动作。目前已在 Gym 环境提供九个预训练模型检查点。
Hugging Face 发布机器学习专家系列访谈,邀请前 Google 伦理 AI 团队联合创始人 Margaret Mitchell 探讨 AI 伦理。她分享了在 Microsoft 开发 Seeing AI 时因数据偏差产生的顿悟,指出模型对图像中灾难场景的误判可能带来严重后果。访谈还讨论了 ML 团队如何识别有害数据偏见,以及包容性文化对提升 AI 性能与公平性的价值。
Hugging Face 推出为期 9 个月的 AI 研究驻留项目,旨在帮助申请人成长为具有影响力的 AI 研究人员。入选者将与 Hugging Face 科学团队研究员合作,以开放协作的方式开发新的机器学习技术并发表成果。该项目面向所有背景开放,优先考虑能体现积极社会影响及多元化背景的申请者,申请截止于 2022 年 4 月 3 日。
AWS Inferentia 通过定制芯片提供最高 2.3 倍吞吐量和 80% 更低推理成本。Hugging Face 发布端到端教程,演示如何结合 Amazon SageMaker 将 BERT 模型转换为 AWS Neuron 格式并部署实时推理端点。该方案支持通过自定义 inference.py 脚本在 Neuron Core 上运行文本分类任务。
Hugging Face Transformers 库新增受限束搜索(Constrained Beam Search)功能,允许在文本生成过程中强制包含特定词汇或短语。该功能支持强制词、析取约束及自定义约束对象,通过 Bank 轮询机制平衡约束满足与输出合理性。
推荐理由:原文介绍了如何在生成阶段强制包含特定词汇或短语,为需要精确控制输出的场景提供了可迁移的方法。
本文介绍如何使用 🤗 Transformers 微调 Vision Transformer (ViT) 进行图像分类。通过加载 beans 数据集,利用 ViTImageProcessor 将图像转换为像素值张量,并对预训练的 google/vit-base-patch16-224-in21k 模型进行微调。
情感分析通过自动标记文本极性,帮助企业大规模处理数据并自动化业务流程。Hugging Face Hub 提供超过 215 个公开的情感分析模型,集成仅需 5 行 Python 代码。用户可直接调用预训练模型,或基于自身数据微调模型以提升特定场景的准确率。
Wav2Vec2 利用 CTC 架构特性,通过分块与步长(stride)技术实现超长音频或实时语音识别。该方法将音频切分为重叠片段,丢弃边缘预测结果后拼接,从而在有限显存下避免 O(n²) 复杂度爆炸。用户只需在 pipeline 中设置 chunk_length_s 即可直接处理任意长度音频。
Hugging Face 博客介绍 huggingface_hub 库新增的搜索功能,旨在降低用户通过 API 在 Hub 上查找模型和数据集的门槛。通过引入 ModelSearchArguments 和 ModelFilter 类,用户无需记忆复杂的查询语法,即可在 Jupyter 或 Python 环境中直接筛选特定任务、数据集和库的模型。
Hugging Face Infinity 在 Amazon EC2 C6i 实例上实现了 Transformer 模型的毫秒级推理延迟。该方案在 Ice Lake 架构上相比 Cascade Lake 实例延迟和吞吐量提升 34%,相比原生 Transformers 提升 800%。Infinity 提供包含预处理和后处理的端到端优化,支持序列分类等任务。
🤗 Transformers 库现已集成 Kensho Technologies 的 pyctcdecode 库,支持在 Wav2Vec2 推理时结合 n-gram 语言模型。该功能通过 Wav2Vec2ProcessorWithLM 接口加载预训练的 4-gram 模型,解决无语言模型时出现的拼写错误问题,显著提升语音识别准确率。
Hugging Face 宣布收购机器学习初创公司 Gradio。Gradio 自 2019 年发布以来已构建超过 30 万个演示,旨在让非技术用户也能通过浏览器轻松访问和反馈模型。此次收购将结合 Hugging Face 的开源生态,进一步降低机器学习的使用门槛。
Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频及点云等多种模态及其组合的 Transformer 模型。该模型通过在潜在变量上应用自注意力机制,使计算复杂度仅随输入大小线性增长,从而解决了传统 Transformer 在处理高维数据时计算和内存扩展性差的问题。
Hugging Face 发布从零训练 CodeParrot 🦜 的教程,该模型基于 1.5B 参数的 GPT-2 架构,可自动补全 Python 代码。教程展示了如何清洗 50GB 的 GitHub 数据集、训练专用 Tokenizer 并使用 🤗 Accelerate 库进行多 GPU 训练。
Hugging Face 发布首个基于 Unity ML-Agents 的自定义深度强化学习环境 Snowball Fight。该环境支持 1v1 对战,已开源并托管于 Hugging Face Hub 和 Spaces。未来计划推出 2v2 协作版本及更多自定义环境。
Hugging Face 与 Graphcore 合作推出 Optimum Graphcore 库,使开发者能轻松在 IPU 上加速 Transformer 模型。文章以 BERT 为例,演示了如何在 Graphcloud 环境中配置 Poplar SDK 和 PopTorch,并通过安装 optimum[graphcore] 包实现模型微调。
Hugging Face 推出开源 Data Measurements Tool,提供无代码界面与 Python 库,用于交互式测量、构建和比较数据集。该工具支持查看数据集基础信息、描述性统计及分布统计,帮助用户分析词汇分布、标签平衡性、重复项及 Zipf 定律符合度,以评估数据质量与代表性。
Hugging Face 于 11 月 15 日发布课程第二部分,聚焦文本分类之外的常见 NLP 任务及 🤗 Datasets 和 🤗 Tokenizers 等生态工具。官方同步举办为期两天的社区活动,涵盖 Transformers 原理与训练工具讲座,并提供由 AWS 赞助的免费 Amazon SageMaker 算力用于模型微调实战。参与者完成项目后可获结业证书。
Hugging Face团队分享了使用10亿对训练数据训练Sentence Embedding模型的方法,采用对比学习和Multiple Negative Ranking Loss,在多个通用任务上达到SOTA。