WHOOP 利用 GPT-4 提供个性化健身与健康指导
WHOOP 利用 GPT-4 提供个性化健身与健康指导。该方案通过集成大语言模型技术,为用户提供定制化的健康建议与训练反馈。
WHOOP 利用 GPT-4 提供个性化健身与健康指导。该方案通过集成大语言模型技术,为用户提供定制化的健康建议与训练反馈。
Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。
推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。
Hugging Face 发布用于 SDXL Dreambooth LoRA 微调的高级训练脚本,结合 Pivotal Tuning 与 Prodigy 优化器,并支持 Textual Inversion 嵌入加载。
推荐理由:原文提供了结合Pivotal Tuning与Prodigy优化器的SDXL LoRA训练脚本,读者可直接复用该配置提升微调效果。
Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。
推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。
Hugging Face 发布 2023 年开源大模型年度回顾,指出行业从规模竞赛转向数据竞赛,LLaMA、Mistral 等中小模型爆发。文章详细梳理了 RLHF、DPO 等对话微调技术的普及,以及模型合并、PEFT 和量化等技术如何推动开源生态发展。
推荐理由:梳理了2023年开源大模型从规模竞赛转向数据竞赛的演进脉络及社区微调生态。
Summer Health 利用 OpenAI 重塑儿科就诊记录,旨在提高儿科医生就诊笔记的准确性。该方案通过引入 OpenAI 技术优化医疗文书处理流程,提升临床记录效率。
OpenAI 宣布启动 1000 万美元的 Superalignment Fast Grants 专项基金,旨在支持针对超人类 AI 系统对齐与安全的技术研究,涵盖弱到强泛化、可解释性及可扩展监督等方向。
推荐理由:OpenAI 设立千万美元专项基金支持超人类 AI 的对齐与安全研究,为相关领域提供资金支持。
OpenAI 提出弱到强泛化这一超对齐新方向,旨在利用深度学习的泛化特性,通过弱监督者来控制强模型。该研究展示了利用弱模型引导强模型行为的初步可行结果,为模型对齐提供了新的技术路径。
OpenAI 与 Axel Springer 达成合作,成为首家在 AI 技术中深度整合新闻业务的出版集团。此次合作旨在深化有益的人工智能应用,推动新闻行业的技术融合。
Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。
推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。
Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。
推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。
Hugging Face 发布博文详解 MoE 架构原理,涵盖稀疏性、负载均衡、训练稳定性及推理部署策略,并列举了 Mixtral 8x7B 等开源项目。
推荐理由:文章系统梳理了MoE的架构原理、训练技巧与推理部署策略,为理解和应用MoE模型提供了详实的参考。
Hugging Face 与 Intel Labs 联合发布 SetFitABSA,这是一种基于 SetFit 框架的少样本方面级情感分析(ABSA)技术。该方法无需设计 Prompt,通过提取方面候选词并分类,在 Laptop14 和 Restaurant14 数据集上以 2.2 亿参数规模在少样本场景下表现优于 Llama-2 和 T5。
推荐理由:SetFitABSA 提供了无需 Prompt 且训练极快的少样本情感分析方案,适合资源受限场景。
Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。
推荐理由:通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。
Hugging Face 通过动态加载和卸载 LoRA 适配器,在保持基础模型常驻的情况下实现多用户推理,将响应时间从 35 秒降至 13 秒,并提供了基于 Diffusers 库的具体实现代码。
推荐理由:Hugging Face 分享了动态加载 LoRA 的技术细节,通过复用基础模型显著降低推理延迟并节省算力。
AMD 与 Hugging Face 合作实现 AMD Instinct GPU 上运行 Hugging Face 模型无需代码修改。支持 Flash Attention v2、Paged Attention 及 GPTQ 等优化,MI250 解码吞吐量较 A100 提升 2.33 倍。Text Generation Inference 已初步支持 MI210 和 MI250。
Hugging Face 发现 Open LLM Leaderboard 中 DROP 基准测试的 F1 分数普遍低于 10,主要因归一化算法对非空格字符处理不当及句号截断生成导致。改用换行符截断后,分数与模型整体性能的相关性显著改善。
OpenAI宣布Sam Altman回归担任CEO,Mira Murati担任CTO,Greg Brockman担任总裁,公司同时组建了新的初始董事会。
推荐理由:原文确认了OpenAI管理层变动及新董事会组建,为理解公司后续战略走向提供了关键事实依据。
OpenAI 致力于创建用于 AI 训练的开源和私有数据集。
Hugging Face 发布 Latent Consistency LoRAs,通过加载轻量级适配器将 SDXL 图像生成步数从 25-50 步降至 4-8 步,在 4090 上生成速度提升至不到 1 秒。
推荐理由:原文给出了基于LoRA的加速推理代码和基准测试,读者可以据此判断它在不同硬件上的实际加速效果。
Hugging Face 介绍利用 optimum-neuron 在 AWS Inferentia2 上部署 Llama 2 大语言模型。通过 Neuron Deep Learning AMI 或 SageMaker 可快速配置环境,将模型编译导出为 Neuron 格式。
本文对比了 RoBERTa-large、Llama 2-7b 和 Mistral 7B v0.1 在灾难推文分类任务中的性能。研究利用 PEFT 技术中的 LoRA 对这三个预训练模型进行微调,以显著减少可训练参数。实验在单张 A6000 GPU 上进行,旨在评估不同规模模型在序列分类任务中的表现。
Explosion 发布 Prodigy-HF 插件,实现标注工具 Prodigy 与 Hugging Face 生态的直接集成。该插件支持通过命令行直接微调 Hugging Face Hub 上的 Transformer 模型,并允许将标注好的数据集上传至 Hugging Face Hub。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo(含 128K 上下文窗口及更低价格)、新 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API。
推荐理由:原文列出了GPT-4 Turbo、新API及DALL·E 3等具体更新,读者可据此评估对现有开发工作流的影响。
OpenAI 宣布推出自定义 GPT 功能,允许用户创建结合指令、额外知识和技能组合的 ChatGPT 定制版本。
推荐理由:原文宣布开放自定义GPT功能,允许用户组合指令、知识与技能,为构建专属智能体提供直接入口。
OpenAI 正在开发应对灾难性风险的准备度方法,以支持高能力 AI 系统的安全。为此,公司组建了专门的准备度团队,并启动了一项相关挑战。
前沿模型论坛宣布新任执行主任及 1000 万美元 AI 安全基金。该论坛由 OpenAI、Anthropic、Google 和 Microsoft 共同发起,此次更新旨在加强行业协作与安全投入。
Renumics Spotlight 提供一行代码即可交互式可视化 Hugging Face datasets 数据,支持通过模型预测和嵌入向量深入分析数据分布与模型失败模式。该工具直接基于 datasets 库构建,无需复制数据即可高效加载表格与非结构化数据,并允许通过 Python API 自定义检查工作流以辅助模型调试。
Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。
推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。
Hugging Face 推出 Text Embeddings Inference (TEI) 解决方案,用于部署开源文本嵌入模型。在 Nvidia A10G 实例上,BAAI/bge-base-en-v1.5 模型以 450+ req/sec 吞吐量运行,成本为 0.00000156$ / 1k tokens,比 OpenAI Embeddings 便宜 64 倍。
Hugging Face 博客详解了 Stable Diffusion XL 的推理优化方法。通过 fp16 精度、SDPA 注意力机制、torch.compile 编译及 CPU 卸载等技术,在 A100 上显著降低了显存占用并提升了生成速度。
推荐理由:文章实测了 fp16、SDPA、torch.compile 及显存优化技巧,提供了可复用的代码与性能数据。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 版本中正式可用。官方表示已开发安全缓解措施以准备广泛发布,并分享了关于溯源研究的最新进展。
推荐理由:DALL·E 3 正式面向 Plus 和 Enterprise 用户开放,标志着图像生成能力的进一步普及。
Hugging Face 发布 Gradio-Lite,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。该方案支持多文件和额外依赖安装,具备低延迟和隐私安全优势,但首次加载需 5-15 秒且依赖包兼容性受限。
推荐理由:Gradio-Lite 将应用运行移至浏览器端,免去了服务器部署成本,适合快速分享和隐私保护场景。
Retool 利用 GPT-4 为企业提供一种快速、安全的 AI 应用构建方式。该方案旨在帮助业务人员高效开发具备 AI 能力的内部工具,提升开发效率与安全性。
Typeform 结合 GPT-3.5 和 GPT-4 将在线表单演变为动态和对话式的数据收集体验。
Ironclad 引入 GPT-4 以简化合同审查流程。该方案通过集成前沿大语言模型能力,旨在提升法律文档处理的效率与准确性。
ONNX Runtime 可加速 Hugging Face 上超过 13 万个支持 ONNX 的模型,涵盖 BERT、GPT2 等 90 多种架构。以 whisper-tiny 为例,其推理延迟较 PyTorch 最高提升 74.30%。该工具与 Hugging Face 紧密合作,确保站内热门模型获得性能优化。
Hugging Face Diffusers 新增对 JAX 的支持,可在 Google Cloud TPU v5e 上高效运行 Stable Diffusion XL。该方案利用 JIT 编译和 pmap 并行化,在 TPU v5e-4 实例上生成 1024×1024 图像的实际耗时约 2.3 秒。TPU v5e 成本低于 TPU v4 的一半,显著提升了大规模 AI 推理的性能与性价比。
Hugging Face 在 Tokenizer 中引入 chat_template 属性,使用 Jinja 模板保存模型训练时的对话格式,防止因格式不匹配导致性能下降。用户可通过 apply_chat_template() 方法格式化输入,或提交 PR 为缺少模板的模型补充模板。
推荐理由:Hugging Face 在 Tokenizer 中引入 chat_template 属性,通过保存训练时的对话格式来避免推理时的性能下降。
最多提供 50 页,更早的内容请使用搜索或主题页。