Prodigy-HF 发布:实现与 Hugging Face 生态的直接集成
Explosion 发布 Prodigy-HF 插件,实现标注工具 Prodigy 与 Hugging Face 生态的直接集成。该插件支持通过命令行直接微调 Hugging Face Hub 上的 Transformer 模型,并允许将标注好的数据集上传至 Hugging Face Hub。
Explosion 发布 Prodigy-HF 插件,实现标注工具 Prodigy 与 Hugging Face 生态的直接集成。该插件支持通过命令行直接微调 Hugging Face Hub 上的 Transformer 模型,并允许将标注好的数据集上传至 Hugging Face Hub。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo(含 128K 上下文窗口及更低价格)、新 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API。
推荐理由:原文列出了GPT-4 Turbo、新API及DALL·E 3等具体更新,读者可据此评估对现有开发工作流的影响。
OpenAI 宣布推出自定义 GPT 功能,允许用户创建结合指令、额外知识和技能组合的 ChatGPT 定制版本。
推荐理由:原文宣布开放自定义GPT功能,允许用户组合指令、知识与技能,为构建专属智能体提供直接入口。
Hugging Face 博客发布教程,展示如何基于 StarCoder 模型微调专属编程助手。文章详细说明了从 GitHub 抓取代码构建数据集、使用 QLoRA 在单卡 A100 上微调、结合多个 LoRA 适配器,以及通过 MLC 在本地 Mac 设备上部署的完整流程。
推荐理由:文章提供了从数据清洗到QLoRA微调及本地部署的完整代码,可迁移用于构建私有代码库的专属编程助手。
OpenAI 正在开发应对灾难性风险的准备度方法,以支持高能力 AI 系统的安全。为此,公司组建了专门的准备度团队,并启动了一项相关挑战。
前沿模型论坛宣布新任执行主任及 1000 万美元 AI 安全基金。该论坛由 OpenAI、Anthropic、Google 和 Microsoft 共同发起,此次更新旨在加强行业协作与安全投入。
Renumics Spotlight 提供一行代码即可交互式可视化 Hugging Face datasets 数据,支持通过模型预测和嵌入向量深入分析数据分布与模型失败模式。该工具直接基于 datasets 库构建,无需复制数据即可高效加载表格与非结构化数据,并允许通过 Python API 自定义检查工作流以辅助模型调试。
Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。
推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。
Hugging Face 推出 Text Embeddings Inference (TEI) 解决方案,用于部署开源文本嵌入模型。在 Nvidia A10G 实例上,BAAI/bge-base-en-v1.5 模型以 450+ req/sec 吞吐量运行,成本为 0.00000156$ / 1k tokens,比 OpenAI Embeddings 便宜 64 倍。
Hugging Face 博客详解了 Stable Diffusion XL 的推理优化方法。通过 fp16 精度、SDPA 注意力机制、torch.compile 编译及 CPU 卸载等技术,在 A100 上显著降低了显存占用并提升了生成速度。
推荐理由:文章实测了 fp16、SDPA、torch.compile 及显存优化技巧,提供了可复用的代码与性能数据。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 版本中正式可用。官方表示已开发安全缓解措施以准备广泛发布,并分享了关于溯源研究的最新进展。
推荐理由:DALL·E 3 正式面向 Plus 和 Enterprise 用户开放,标志着图像生成能力的进一步普及。
Hugging Face 发布 Gradio-Lite,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。该方案支持多文件和额外依赖安装,具备低延迟和隐私安全优势,但首次加载需 5-15 秒且依赖包兼容性受限。
推荐理由:Gradio-Lite 将应用运行移至浏览器端,免去了服务器部署成本,适合快速分享和隐私保护场景。
Retool 利用 GPT-4 为企业提供一种快速、安全的 AI 应用构建方式。该方案旨在帮助业务人员高效开发具备 AI 能力的内部工具,提升开发效率与安全性。
Typeform 结合 GPT-3.5 和 GPT-4 将在线表单演变为动态和对话式的数据收集体验。
Ironclad 引入 GPT-4 以简化合同审查流程。该方案通过集成前沿大语言模型能力,旨在提升法律文档处理的效率与准确性。
ONNX Runtime 可加速 Hugging Face 上超过 13 万个支持 ONNX 的模型,涵盖 BERT、GPT2 等 90 多种架构。以 whisper-tiny 为例,其推理延迟较 PyTorch 最高提升 74.30%。该工具与 Hugging Face 紧密合作,确保站内热门模型获得性能优化。
Hugging Face Diffusers 新增对 JAX 的支持,可在 Google Cloud TPU v5e 上高效运行 Stable Diffusion XL。该方案利用 JIT 编译和 pmap 并行化,在 TPU v5e-4 实例上生成 1024×1024 图像的实际耗时约 2.3 秒。TPU v5e 成本低于 TPU v4 的一半,显著提升了大规模 AI 推理的性能与性价比。
Hugging Face 在 Tokenizer 中引入 chat_template 属性,使用 Jinja 模板保存模型训练时的对话格式,防止因格式不匹配导致性能下降。用户可通过 apply_chat_template() 方法格式化输入,或提交 PR 为缺少模板的模型补充模板。
推荐理由:Hugging Face 在 Tokenizer 中引入 chat_template 属性,通过保存训练时的对话格式来避免推理时的性能下降。
Hugging Face 发布教程,指导用户利用 Inference API 部署 AI Comic Factory 以避免长等待时间。该应用基于 Llama-2 和 SDXL 1.0 模型,需配置 LLM_ENGINE 和 RENDERING_API 环境变量为 INFERENCE_API。此功能目前处于早期阶段,尚不支持 SDXL 的 refiner 步骤或放大功能。
Hugging Face 分享 2023 年夏季在伦理与社会领域的进展,包括高管向美欧立法机构提供 AI 监管建议及大量媒体发声。团队在 IDEFICS 多模态模型上应用偏见测试,更新内容政策,并通过机器学习改进元数据以支持语言多样性。
Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。
推荐理由:TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。
Hugging Face 发布教程,指导非工程师使用 Spaces、AutoTrain 和 ChatUI 训练 LLaMA 2 聊天机器人。通过 GUI 界面,用户无需编写代码即可利用 Alpaca 指令微调数据集对 Llama 2 7b 模型进行微调,并部署为可分享的聊天应用。
Mistral AI 发布 Mistral 7B 模型,在多项英文及代码基准上超越 13B 参数模型,以 Apache 2.0 协议开源。该模型推理速度快、成本低,适用于摘要、问答等任务。
推荐理由:Mistral 7B 在多项基准上超越 13B 模型,Apache 2.0 开源,为端侧部署提供高性能替代方案。
Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。
推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,评估了 7B、13B 和 70B 参数规模模型在不同 EC2 实例和负载下的延迟与吞吐量。测试涵盖 GPTQ 4-bit 量化技术,旨在为最具成本效益、最佳延迟和最佳吞吐量场景提供优化策略。
ChatGPT 新增视觉、听觉和语音交互能力。
推荐理由:标题明确指出了ChatGPT新增视觉、听觉和语音交互能力,标志着产品向多模态交互演进。
Hugging Face 推出 Inference for PROs,为付费用户提供精选模型的专属 API 端点及更高速率限制。该服务支持 Meta Llama 3、Mixtral 8x7B 等模型,利用 text-generation-inference 实现极速推理。PRO 用户可借此便捷地进行原型开发与测试,无需自行部署基础设施。
OpenAI 宣布开放红队测试网络(Red Teaming Network)招募,邀请领域专家加入以提升模型安全性。该计划旨在通过外部专家的协助,完善 OpenAI 模型的安全防护机制。
Rocket Money 选择 Hugging Face Inference API 替代原有正则系统,以支撑其个人理财应用中超过 4000 个类别的交易分类任务。该方案成功应对了每月 1 亿笔交易的突发负载,实现了动态扩展与低延迟推理。经过三个月评估,Rocket Money 确认该服务具备高可用性,并与其建立了紧密的技术合作伙伴关系。
Hugging Face 发布目标检测排行榜,对 Hub 上的开源模型进行排名。文章详细解析了平均精度(AP)和平均召回率(AR)等核心指标的计算方法,并揭示了评估过程中可能出现的差异与陷阱,帮助开发者根据具体需求筛选最佳模型。
Hugging Face 博客详解 3D Gaussian Splatting 技术,将其核心拆解为从运动结构(SfM)生成点云、转换为高斯分布、通过随机梯度下降训练以及可微光栅化渲染四个步骤。文章分析了该技术在实时高质量渲染中的优势,同时指出其高显存占用、大磁盘体积及与现有渲染管线不兼容等局限。
推荐理由:文章拆解了3D高斯泼溅从SfM到可微光栅化的完整流程,帮助读者理解这一实时渲染技术的核心机制。
本文介绍降低精度、Flash Attention 及架构创新等技术,以解决大语言模型在推理时的显存与计算挑战。降低精度可将 float32 的 4 * X GB 显存需求降至 bfloat16 的 2 * X GB。
Hugging Face发布教程,展示如何利用PyTorch FSDP在2节点A100集群上微调Llama 2 70B。文章解决了加载模型时的CPU内存溢出、中间检查点保存耗时及VRAM不足三大挑战,通过Flash Attention和梯度检查点等技术实现高效训练。
Hugging Face 发布高效图像生成模型 Würstchen,通过42倍空间压缩实现比 SDXL 更快的推理速度与更低的显存占用。该模型在 Diffusers 库中集成,支持 PyTorch 2.0 SDPA 加速与 torch.compile 优化,并提供多种显存节省策略。
推荐理由:通过42倍极端压缩显著降低训练与推理成本,为资源受限场景提供高效图像生成方案。
Hugging Face 博客对比了 Transformers 中 bitsandbytes 与 auto-gptq 两种原生量化方案。GPTQ 在文本生成推理速度上显著优于 bitsandbytes,而 bitsandbytes 在微调适配器时速度更快且支持跨模态。文章建议先使用 bitsandbytes 进行零样本量化并微调适配器,再使用 GPTQ 量化合并后的模型以部署。
推荐理由:通过实测对比 bitsandbytes 与 GPTQ 在推理与微调中的性能差异,提供量化方案选型与混合使用策略。
Hugging Face 发布 SafeCoder,基于 155 亿参数的 StarCoder 模型提供企业级代码辅助。该方案具备 8192-token 上下文窗口,支持在本地或云端通过 Docker 部署,实现完全的数据隐私与定制化微调。相比 GitHub Copilot 等闭源服务,SafeCoder 提供模型架构、训练数据及详细指标的透明度,并允许企业完全控制基础设施与合规性。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,正式支持适配 Stable Diffusion XL (SDXL) 的 T2I-Adapter。
推荐理由:提供了适配 SDXL 的轻量级控制模型及完整训练推理代码,便于在保持生成质量的同时降低显存与计算开销。
OpenAI 宣布将于 11 月 6 日在旧金山举办首届开发者大会。线下参会的开发者注册将在未来几周开放,全球开发者均可直播观看主题演讲。
Hugging Face 上线了 TII 发布的 180B 参数开源大语言模型 Falcon 180B,该模型在 3.5 万亿 token 上预训练,性能对标 PaLM-2 Large。文章提供了 Transformers 集成代码、量化部署方案及硬件需求参考。
推荐理由:Hugging Face 上线了 180B 参数开源模型,提供了量化部署指南与硬件需求,方便开发者评估与接入。
Fetch 利用 Amazon SageMaker 与 Hugging Face 优化机器学习流水线,将最慢扫描的延迟降低 50%。该方案通过 Amazon SageMaker Model Training 和 Processing 提升文档理解模型精度 200%,并借助 Hugging Face AWS Deep Learning Container 简化部署。