StarCoder 在 Intel Xeon 上结合 Q8/Q4 量化与推测解码实现加速
StarCoder-15B 模型在 Intel 4th Gen Xeon 上结合 8bit 和 4bit 量化与推测解码,实现超过 7 倍的推理加速。Q8-StarCoder 在 HumanEval 上无精度损失,TTFT 和 TPOT 分别提速约 2.19 倍和 2.20 倍。INT4 量化通过减少模型加载时间进一步缓解内存带宽瓶颈。
StarCoder-15B 模型在 Intel 4th Gen Xeon 上结合 8bit 和 4bit 量化与推测解码,实现超过 7 倍的推理加速。Q8-StarCoder 在 HumanEval 上无精度损失,TTFT 和 TPOT 分别提速约 2.19 倍和 2.20 倍。INT4 量化通过减少模型加载时间进一步缓解内存带宽瓶颈。
The Hallucinations Leaderboard 是一个开放项目,旨在通过特定基准评估大语言模型在事实性和忠实性方面的幻觉问题。该基准利用 EleutherAI Language Model Evaluation Harness,涵盖闭卷问答、摘要、阅读理解、指令遵循、事实核查及幻觉检测等任务。
Hugging Face 发布 AI Secure LLM Safety Leaderboard,基于 DecodingTrust 框架评估大语言模型安全性。该榜单涵盖毒性、偏见、对抗鲁棒性、隐私、伦理和公平性等维度,提供红队测试算法与详细报告。研究发现 GPT-4 比 GPT-3.5 更易受攻击,且无单一模型在所有维度均占优。
Hugging Face 发布开源智能体库 smolagents 并集成 ChatHuggingFace 到 LangChain。实测显示 Mixtral-8x7B 在 ReAct 基准中超越 GPT-3.5,且具备通过微调进一步提升的潜力。
推荐理由:Hugging Face 发布 smolagents 库并实测开源模型,Mixtral 在 Agent 基准中超越 GPT-3.5。
IBM与Hugging Face联合在Transformers库中发布PatchTSMixer,这是一种基于MLP-Mixer架构的轻量级时间序列建模方法。该模型在预测任务中比现有MLP和Transformer模型性能提升8-60%,同时内存和运行时间减少2-3倍。文章提供了在Electricity和ETTh2数据集上进行预测、零样本迁移学习和微调的完整代码示例。
推荐理由:IBM与Hugging Face联合发布PatchTSMixer,提供轻量级时间序列预测方案及完整教程。
Hugging Face发布教程,演示如何使用Transformers微调Meta的W2V2-BERT模型进行低资源语音识别。文章以蒙古语为例,展示从数据预处理到CTC训练的全流程,该模型在低资源语言上可实现接近Whisper-large-v3的准确率,且推理速度快10-30倍。
推荐理由:文章提供了基于Transformers微调W2V2-BERT处理低资源语音的完整代码与技巧,可迁移至其他小语种场景。
Hugging Face 在 alignment-handbook 中实测对比了 DPO、IPO 和 KTO 三种无需强化学习的偏好对齐算法。实验基于 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 模型,使用 MT-Bench 评估发现 DPO 在成对偏好设置中表现最佳,且对超参数 beta 的敏感性因基座模型而异。
推荐理由:通过MT-Bench实测对比DPO、IPO、KTO三种对齐算法,揭示了超参数敏感性并给出最佳实践参考。
OpenAI 资助了全球 10 个团队,旨在设计共同治理 AI 的理念与工具。文章总结了相关创新成果,概述了项目经验教训,并呼吁研究人员和工程师加入后续工作。
OpenAI 致力于防止 AI 滥用,提供关于 AI 生成内容的透明度,并改善对准确投票信息的访问。
Hugging Face 发布教程,介绍使用 ONNX Runtime 和 Olive 工具优化 SD Turbo 和 SDXL Turbo 的推理性能。在 NVIDIA GPU 上,ONNX Runtime 相比 PyTorch 吞吐量最高提升 229%,并提供了 C# 和 Java 等非 Python 语言的推理示例。
Hugging Face发布教程,演示如何将ComfyUI工作流导出为Python脚本,封装为Gradio应用,并部署至Spaces ZeroGPU实现免费推理。以Flux模型为例,详细讲解模型映射、代码重构及模型预加载优化。
推荐理由:提供将ComfyUI工作流转为Gradio并部署至ZeroGPU的完整代码,实现免费服务器端推理。
Digital Green 利用 OpenAI 技术为农民建立农业数据库,旨在提高农民收入。
Vectara 基于 Hugging Face Leaderboard 模板发布了 Hughes Hallucination Evaluation Model (HHEM) 榜单,用于评估 GPT-4、Gemini 和 Llama 2 等模型在文档摘要中的幻觉频率。
OpenAI 宣布推出 GPT Store。
OpenAI 推出面向各规模团队的 ChatGPT 新订阅方案,提供安全、协作的工作空间,旨在帮助用户在工作中更高效地使用 ChatGPT。
推荐理由:OpenAI 推出面向团队的 ChatGPT 订阅方案,提供安全协作空间,旨在优化工作场景下的使用体验。
Hugging Face 博客介绍社区工具 Unsloth,通过重写 PyTorch 模块为 Triton 内核,使 LLM 微调速度提升最高 2.7 倍,显存占用降低最高 74%,且精度无损失。该工具兼容 Hugging Face 生态,支持 Llama 和 Mistral 架构,并可直接与 TRL 库集成使用。
推荐理由:文章提供了基于Triton内核优化的具体代码示例,帮助读者在保持精度的同时显著降低显存占用并提升微调速度。
OpenAI 明确表示支持新闻业并与新闻机构合作。公司认为《纽约时报》提起的诉讼毫无根据。
WHOOP 利用 GPT-4 提供个性化健身与健康指导。该方案通过集成大语言模型技术,为用户提供定制化的健康建议与训练反馈。
Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。
推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。
Hugging Face 发布用于 SDXL Dreambooth LoRA 微调的高级训练脚本,结合 Pivotal Tuning 与 Prodigy 优化器,并支持 Textual Inversion 嵌入加载。
推荐理由:原文提供了结合Pivotal Tuning与Prodigy优化器的SDXL LoRA训练脚本,读者可直接复用该配置提升微调效果。
Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。
推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。
Hugging Face 发布 2023 年开源大模型年度回顾,指出行业从规模竞赛转向数据竞赛,LLaMA、Mistral 等中小模型爆发。文章详细梳理了 RLHF、DPO 等对话微调技术的普及,以及模型合并、PEFT 和量化等技术如何推动开源生态发展。
推荐理由:梳理了2023年开源大模型从规模竞赛转向数据竞赛的演进脉络及社区微调生态。
Summer Health 利用 OpenAI 重塑儿科就诊记录,旨在提高儿科医生就诊笔记的准确性。该方案通过引入 OpenAI 技术优化医疗文书处理流程,提升临床记录效率。
OpenAI 宣布启动 1000 万美元的 Superalignment Fast Grants 专项基金,旨在支持针对超人类 AI 系统对齐与安全的技术研究,涵盖弱到强泛化、可解释性及可扩展监督等方向。
推荐理由:OpenAI 设立千万美元专项基金支持超人类 AI 的对齐与安全研究,为相关领域提供资金支持。
OpenAI 提出弱到强泛化这一超对齐新方向,旨在利用深度学习的泛化特性,通过弱监督者来控制强模型。该研究展示了利用弱模型引导强模型行为的初步可行结果,为模型对齐提供了新的技术路径。
OpenAI 与 Axel Springer 达成合作,成为首家在 AI 技术中深度整合新闻业务的出版集团。此次合作旨在深化有益的人工智能应用,推动新闻行业的技术融合。
Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。
推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。
Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。
推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。
Hugging Face 发布博文详解 MoE 架构原理,涵盖稀疏性、负载均衡、训练稳定性及推理部署策略,并列举了 Mixtral 8x7B 等开源项目。
推荐理由:文章系统梳理了MoE的架构原理、训练技巧与推理部署策略,为理解和应用MoE模型提供了详实的参考。
Hugging Face 与 Intel Labs 联合发布 SetFitABSA,这是一种基于 SetFit 框架的少样本方面级情感分析(ABSA)技术。该方法无需设计 Prompt,通过提取方面候选词并分类,在 Laptop14 和 Restaurant14 数据集上以 2.2 亿参数规模在少样本场景下表现优于 Llama-2 和 T5。
推荐理由:SetFitABSA 提供了无需 Prompt 且训练极快的少样本情感分析方案,适合资源受限场景。
Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。
推荐理由:通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。
Hugging Face 通过动态加载和卸载 LoRA 适配器,在保持基础模型常驻的情况下实现多用户推理,将响应时间从 35 秒降至 13 秒,并提供了基于 Diffusers 库的具体实现代码。
推荐理由:Hugging Face 分享了动态加载 LoRA 的技术细节,通过复用基础模型显著降低推理延迟并节省算力。
AMD 与 Hugging Face 合作实现 AMD Instinct GPU 上运行 Hugging Face 模型无需代码修改。支持 Flash Attention v2、Paged Attention 及 GPTQ 等优化,MI250 解码吞吐量较 A100 提升 2.33 倍。Text Generation Inference 已初步支持 MI210 和 MI250。
Hugging Face 发现 Open LLM Leaderboard 中 DROP 基准测试的 F1 分数普遍低于 10,主要因归一化算法对非空格字符处理不当及句号截断生成导致。改用换行符截断后,分数与模型整体性能的相关性显著改善。
OpenAI宣布Sam Altman回归担任CEO,Mira Murati担任CTO,Greg Brockman担任总裁,公司同时组建了新的初始董事会。
推荐理由:原文确认了OpenAI管理层变动及新董事会组建,为理解公司后续战略走向提供了关键事实依据。
OpenAI 致力于创建用于 AI 训练的开源和私有数据集。
Hugging Face 发布 Latent Consistency LoRAs,通过加载轻量级适配器将 SDXL 图像生成步数从 25-50 步降至 4-8 步,在 4090 上生成速度提升至不到 1 秒。
推荐理由:原文给出了基于LoRA的加速推理代码和基准测试,读者可以据此判断它在不同硬件上的实际加速效果。
Hugging Face 介绍利用 optimum-neuron 在 AWS Inferentia2 上部署 Llama 2 大语言模型。通过 Neuron Deep Learning AMI 或 SageMaker 可快速配置环境,将模型编译导出为 Neuron 格式。
本文对比了 RoBERTa-large、Llama 2-7b 和 Mistral 7B v0.1 在灾难推文分类任务中的性能。研究利用 PEFT 技术中的 LoRA 对这三个预训练模型进行微调,以显著减少可训练参数。实验在单张 A6000 GPU 上进行,旨在评估不同规模模型在序列分类任务中的表现。