跳到正文

#Hugging Face

今日 0 条
7月13日周三
  1. Hugging Face Blog42

    使用 Sentence Transformers 构建播放列表生成器

    文章详解了利用 Sentence Transformers 库和 Gradio 构建播放列表生成器的技术实现。项目选用 msmarco-MiniLM-L-6-v3 模型,通过将歌词拆分为诗节并生成嵌入向量,实现基于文本提示的语义搜索。演示应用使用 Gradio Blocks API 构建多步交互,支持用户输入提示词并查看匹配的歌词。

7月12日周二
  1. Hugging Face Blog77

    Hugging Face 发布全球最大开源多语言大模型 BLOOM

    Hugging Face 发布全球最大开源多语言大语言模型 BLOOM,拥有 1760 亿参数,支持 46 种自然语言和 13 种编程语言。该模型由 1000 多名研究人员历时 117 天训练完成,首次开源了完整的训练检查点和优化器状态,并提供基于 TPU 的推理 API 供社区测试。

    推荐理由:开源了1760亿参数多语言模型及训练检查点,为研究大模型内部机制提供了完整的透明数据。

7月7日周四
  1. Hugging Face Blog35

    如何在 Twitter 上开展情感分析

    本文介绍了利用机器学习模型自动识别推文情感极性的方法,帮助企业实时监测用户反馈与潜在公关危机。针对开发者,教程演示了结合 Tweepy 与 Inference API 进行情感分析;非编程用户则可通过 Zapier 将推文数据自动同步至 Google Sheets。

6月30日周四
  1. Hugging Face Blog12

    使用 PyTorch 实现策略梯度算法

    Hugging Face 发布 Deep Reinforcement Learning Class 第 5 单元,介绍并从头使用 PyTorch 实现 Reinforce 算法。该策略梯度方法直接优化策略权重,无需学习值函数,能学习随机策略并处理高维及连续动作空间。文章随后将在 CartPole-v1、PixelCopter 和 Pong 环境中测试其鲁棒性。

6月29日周三
6月28日周二
  1. Hugging Face Blog37

    Hugging Face 推出 Evaluation on the Hub,无需代码即可评估模型

    Hugging Face 推出 Evaluation on the Hub,基于 AutoTrain 实现无需编写代码即可在 Hub 上评估任意模型。该工具支持一键生成包含验证性能的 Pull Request 并更新模型卡片元数据。主要应用场景包括查找任务最佳模型、在新数据集上评估基线模型以及在多个相关数据集上评估模型。

6月23日周四
  1. Hugging Face Blog33

    Hugging Face 入门教程:使用 Inference API 和 Sentence Transformers 生成 Embeddings

    Hugging Face 发布入门教程,展示如何使用 Inference API 和 Sentence Transformers 库中的 sentence-transformers/all-MiniLM-L6-v2 模型生成文本和图像的 Embeddings。教程通过构建美国社会保障 Medicare 常见问题解答引擎,演示了将数据集嵌入、上传至 Hub 以及通过语义相似度匹配用户查询的完整流程。

6月22日周三
6月14日周二
6月7日周二
5月23日周一
  1. Hugging Face Blog43

    TAPEX:无需真实数据的高效表格预训练方法

    TAPEX 通过利用合成 SQL 查询及其执行结果作为预训练数据,实现了无需真实数据的表格预训练。该模型在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准测试中均取得新的 SOTA 结果,并在所有数据集上大幅超越 BART 及此前方法。TAPEX 模型已集成至 🤗 Transformers 4.19.0 并支持交互式演示。

5月20日周五
5月19日周四
  1. Hugging Face Blog12

    Hugging Face 多模态项目伦理宪章:将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习小组发布伦理宪章,将伦理原则置于机器学习研究生命周期核心。该宪章明确禁止推广暴力、歧视及生成虚假信息等滥用行为,并确立透明、开放、公平及自我批判等价值观。文件注明为 2022 年 5 月的工作进展,旨在通过公开决策接受社区反馈并持续迭代。

5月18日周三
  1. Hugging Face Blog13

    Hugging Face 深度强化学习课程:Q-Learning 入门(第 1 部分)

    Hugging Face 推出深度强化学习免费课程,本文作为第一部分深入讲解基于价值的方法及 Q-Learning 算法。内容涵盖状态价值函数、动作价值函数、贝尔曼方程以及蒙特卡洛与时间差分学习的区别,并介绍从零实现 Q-Learning 智能体。该智能体将在 Frozen-Lake-v1 和出租车导航环境中进行训练,为后续学习 Deep Q-Learning 奠定基础。

5月17日周二
  1. Hugging Face Blog20

    宣布推出 Hugging Face Fellowship 项目

    Hugging Face 宣布推出 Fellowship 项目,旨在支持对机器学习开源生态做出卓越贡献的开发者。该项目通过提供计算资源、官方认可等个性化福利,赋能关键贡献者扩大影响力。首批入选者包括在西班牙语 NLP、模型贡献及 TensorFlow 架构优化等领域表现突出的多位开发者。

5月16日周一
5月13日周五
5月10日周二
5月9日周一
  1. Hugging Face Blog43

    Hugging Face 完成 1 亿美元 C 轮融资

    Hugging Face 宣布完成由 Lux Capital 领投的 1 亿美元 C 轮融资。该平台已托管 10 万个预训练模型和 1 万个数据集,成为机器学习的核心枢纽。Hugging Face 将利用资金加大在研究、开源产品及负责任 AI 领域的投入,并继续推进 BigScience 等开源大模型项目。

5月6日周五
5月2日周一
  1. Hugging Face Blog60

    使用 PyTorch FSDP 加速大模型训练

    Hugging Face 发布教程介绍如何使用 Accelerate 库集成 PyTorch Fully Sharded Data Parallel (FSDP) 训练大模型。实测显示 FSDP 相比 DDP 可将最大批量提升 2-3 倍,并支持 CPU Offload 在单卡运行 1.5B 模型。文章同时指出 FSDP 目前不支持混合精度,并强调需先准备模型再创建优化器以避免参数组丢失。

    推荐理由:文章通过 GPT-2 实测对比 DDP 与 FSDP,给出显存节省与批量提升数据,提供可直接复用的配置与代码规范。

4月28日周四
  1. Hugging Face Blog45

    使用 Kili 和 HuggingFace AutoTrain 进行观点分类

    HuggingFace AutoTrain 与 Kili 平台结合,构建了用于文本分类的主动学习流水线。AutoTrain 自动化数据清洗、模型选择及超参数优化,支持多标签文本分类等任务。Kili 提供协作式数据标注工具,通过迭代标注与模型重训练,实现对 Google Play Store 中 Medium 应用评论的分类与情感分析。

4月27日周三
4月26日周二
4月25日周一
  1. Hugging Face Blog20

    使用机器学习增强客户服务

    本文介绍如何利用 Hugging Face 生态系统中的机器学习工具模拟真实的客户服务用例。文章详细阐述了定义 NLP 任务、筛选数据集以及选择模型的具体步骤,旨在通过自动化技术识别并优先处理极度不满的客户反馈。

4月22日周五
4月13日周三
4月5日周二
3月28日周一
3月23日周三
  1. Hugging Face Blog19

    Hugging Face 机器学习专家系列:Margaret Mitchell 谈伦理 AI

    Hugging Face 发布机器学习专家系列访谈,邀请前 Google 伦理 AI 团队联合创始人 Margaret Mitchell 探讨 AI 伦理。她分享了在 Microsoft 开发 Seeing AI 时因数据偏差产生的顿悟,指出模型对图像中灾难场景的误判可能带来严重后果。访谈还讨论了 ML 团队如何识别有害数据偏见,以及包容性文化对提升 AI 性能与公平性的价值。

3月22日周二
  1. Hugging Face Blog13

    Hugging Face 推出 AI 研究驻留项目

    Hugging Face 推出为期 9 个月的 AI 研究驻留项目,旨在帮助申请人成长为具有影响力的 AI 研究人员。入选者将与 Hugging Face 科学团队研究员合作,以开放协作的方式开发新的机器学习技术并发表成果。该项目面向所有背景开放,优先考虑能体现积极社会影响及多元化背景的申请者,申请截止于 2022 年 4 月 3 日。

3月16日周三
3月11日周五
  1. Hugging Face Blog65

    Transformers 新增受限束搜索功能

    Hugging Face Transformers 库新增受限束搜索(Constrained Beam Search)功能,允许在文本生成过程中强制包含特定词汇或短语。该功能支持强制词、析取约束及自定义约束对象,通过 Bank 轮询机制平衡约束满足与输出合理性。

    推荐理由:原文介绍了如何在生成阶段强制包含特定词汇或短语,为需要精确控制输出的场景提供了可迁移的方法。

2月11日周五
2月2日周三
  1. Hugging Face Blog13

    使用 Python 入门情感分析

    情感分析通过自动标记文本极性,帮助企业大规模处理数据并自动化业务流程。Hugging Face Hub 提供超过 215 个公开的情感分析模型,集成仅需 5 行 Python 代码。用户可直接调用预训练模型,或基于自身数据微调模型以提升特定场景的准确率。

2月1日周二