SegMoE:开源扩散模型混合专家框架与预训练模型
SegMoE 开源了将多个扩散模型合并为混合专家(MoE)架构的代码与预训练模型,支持 diffusers 并集成于 Hugging Face Hub。该框架通过稀疏 MoE 层替换部分前馈层,发布了 SegMoE-4x2 等版本,旨在结合多个专家模型的优势以提升提示词理解能力。
推荐理由:开源了将多个扩散模型合并为MoE架构的代码与预训练模型,为社区提供了构建高性能图像生成模型的新工具。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
SegMoE 开源了将多个扩散模型合并为混合专家(MoE)架构的代码与预训练模型,支持 diffusers 并集成于 Hugging Face Hub。该框架通过稀疏 MoE 层替换部分前馈层,发布了 SegMoE-4x2 等版本,旨在结合多个专家模型的优势以提升提示词理解能力。
推荐理由:开源了将多个扩散模型合并为MoE架构的代码与预训练模型,为社区提供了构建高性能图像生成模型的新工具。
Hugging Face 发布开源智能体库 smolagents 并集成 ChatHuggingFace 到 LangChain。实测显示 Mixtral-8x7B 在 ReAct 基准中超越 GPT-3.5,且具备通过微调进一步提升的潜力。
推荐理由:Hugging Face 发布 smolagents 库并实测开源模型,Mixtral 在 Agent 基准中超越 GPT-3.5。
IBM与Hugging Face联合在Transformers库中发布PatchTSMixer,这是一种基于MLP-Mixer架构的轻量级时间序列建模方法。该模型在预测任务中比现有MLP和Transformer模型性能提升8-60%,同时内存和运行时间减少2-3倍。文章提供了在Electricity和ETTh2数据集上进行预测、零样本迁移学习和微调的完整代码示例。
推荐理由:IBM与Hugging Face联合发布PatchTSMixer,提供轻量级时间序列预测方案及完整教程。
OpenAI 宣布推出 GPT Store。
OpenAI 推出面向各规模团队的 ChatGPT 新订阅方案,提供安全、协作的工作空间,旨在帮助用户在工作中更高效地使用 ChatGPT。
推荐理由:OpenAI 推出面向团队的 ChatGPT 订阅方案,提供安全协作空间,旨在优化工作场景下的使用体验。
Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。
推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。
Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。
推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。
Hugging Face 与 Intel Labs 联合发布 SetFitABSA,这是一种基于 SetFit 框架的少样本方面级情感分析(ABSA)技术。该方法无需设计 Prompt,通过提取方面候选词并分类,在 Laptop14 和 Restaurant14 数据集上以 2.2 亿参数规模在少样本场景下表现优于 Llama-2 和 T5。
推荐理由:SetFitABSA 提供了无需 Prompt 且训练极快的少样本情感分析方案,适合资源受限场景。
Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。
推荐理由:通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。
Hugging Face 发布 Latent Consistency LoRAs,通过加载轻量级适配器将 SDXL 图像生成步数从 25-50 步降至 4-8 步,在 4090 上生成速度提升至不到 1 秒。
推荐理由:原文给出了基于LoRA的加速推理代码和基准测试,读者可以据此判断它在不同硬件上的实际加速效果。
OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo(含 128K 上下文窗口及更低价格)、新 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API。
推荐理由:原文列出了GPT-4 Turbo、新API及DALL·E 3等具体更新,读者可据此评估对现有开发工作流的影响。
OpenAI 宣布推出自定义 GPT 功能,允许用户创建结合指令、额外知识和技能组合的 ChatGPT 定制版本。
推荐理由:原文宣布开放自定义GPT功能,允许用户组合指令、知识与技能,为构建专属智能体提供直接入口。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 版本中正式可用。官方表示已开发安全缓解措施以准备广泛发布,并分享了关于溯源研究的最新进展。
推荐理由:DALL·E 3 正式面向 Plus 和 Enterprise 用户开放,标志着图像生成能力的进一步普及。
Hugging Face 发布 Gradio-Lite,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。该方案支持多文件和额外依赖安装,具备低延迟和隐私安全优势,但首次加载需 5-15 秒且依赖包兼容性受限。
推荐理由:Gradio-Lite 将应用运行移至浏览器端,免去了服务器部署成本,适合快速分享和隐私保护场景。
Hugging Face 在 Tokenizer 中引入 chat_template 属性,使用 Jinja 模板保存模型训练时的对话格式,防止因格式不匹配导致性能下降。用户可通过 apply_chat_template() 方法格式化输入,或提交 PR 为缺少模板的模型补充模板。
推荐理由:Hugging Face 在 Tokenizer 中引入 chat_template 属性,通过保存训练时的对话格式来避免推理时的性能下降。
Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。
推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。
ChatGPT 新增视觉、听觉和语音交互能力。
推荐理由:标题明确指出了ChatGPT新增视觉、听觉和语音交互能力,标志着产品向多模态交互演进。
Hugging Face 发布高效图像生成模型 Würstchen,通过42倍空间压缩实现比 SDXL 更快的推理速度与更低的显存占用。该模型在 Diffusers 库中集成,支持 PyTorch 2.0 SDPA 加速与 torch.compile 优化,并提供多种显存节省策略。
推荐理由:通过42倍极端压缩显著降低训练与推理成本,为资源受限场景提供高效图像生成方案。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,正式支持适配 Stable Diffusion XL (SDXL) 的 T2I-Adapter。
推荐理由:提供了适配 SDXL 的轻量级控制模型及完整训练推理代码,便于在保持生成质量的同时降低显存与计算开销。