最新精选 第 121–140 条 · 共 147 条 08:00 Hugging Face Blog 精选AI 评分 80 80 Hugging Face 发布 Cosmopedia,这是目前最大的开源合成数据集,包含250亿token和3000万个文件,由 Mixtral-8x7B-Instruct-v0.1 生成。Hugging Face 开源了端到端生成代码、数据集以及基于此训练的 1B 模型 cosmo-1b,详细披露了通过提示词工程和 Web 数据聚类构建大规模预训练数据的完整技术栈。
推荐理由:开源了250亿token合成数据及生成代码,为复现Phi模型提供了可迁移的预训练数据构建方案。
08:00 Hugging Face Blog 精选AI 评分 73 73 BigCode 发布 StarCoder2 系列开源代码大模型,包含 3B、7B 和 15B 三种参数规模。旗舰版 StarCoder2-15B 基于 4 万亿 tokens 的 The Stack v2 数据集训练,在多项评测中表现匹敌 33B 级别模型。同时开源了 The Stack v2 数据集及全部训练代码。
推荐理由:StarCoder2 提供 3B 至 15B 三种尺寸,15B 模型在多项评测中匹敌 33B 级别模型,为开发者提供了高效的开源代码生成选择。
08:00 Hugging Face Blog 精选AI 评分 62 62 Hugging Face 发布 Gemma 模型 LoRA 微调教程,提供基于 Transformers 和 PEFT 库的完整代码,演示使用 QLoRA 进行 4-bit 量化微调,并介绍在 TPU 上通过 FSDP 加速训练的方法。
推荐理由:文章提供了基于LoRA和QLoRA微调Gemma模型的完整代码,并演示了TPU上的FSDP加速方案。
08:00 Hugging Face Blog 精选AI 评分 85 85 Hugging Face 发布 Google Gemma 开源大模型集成指南,提供 2B 和 7B 参数版本。支持 Transformers 和 JAX 权重,兼容 Google Cloud 和 Inference Endpoints 部署,并给出单卡微调示例。
推荐理由:Hugging Face 提供了 Gemma 的完整集成与部署指南,帮助开发者快速上手这款开源模型。
08:00 Hugging Face Blog 精选AI 评分 68 68 SegMoE 开源了将多个扩散模型合并为混合专家(MoE)架构的代码与预训练模型,支持 diffusers 并集成于 Hugging Face Hub。该框架通过稀疏 MoE 层替换部分前馈层,发布了 SegMoE-4x2 等版本,旨在结合多个专家模型的优势以提升提示词理解能力。
推荐理由:开源了将多个扩散模型合并为MoE架构的代码与预训练模型,为社区提供了构建高性能图像生成模型的新工具。
08:00 Hugging Face Blog 精选AI 评分 80 80 Hugging Face 发布基于开源模型的 Constitutional AI 对齐完整教程,包含 SFT 与 DPO 训练配方及 llm-swarm 推理工具。实验显示 Mistral-7B 经 CAI 对齐后在 MT Bench 上保持高有用性,且对 DAN 等越狱攻击具有更强鲁棒性。
推荐理由:提供基于Mistral-7B的Constitutional AI完整复现方案与llm-swarm工具,展示如何在不依赖人工反馈下实现模型自我对齐。
08:00 Hugging Face Blog 精选AI 评分 70 70 Hugging Face 发布开源智能体库 smolagents 并集成 ChatHuggingFace 到 LangChain。实测显示 Mixtral-8x7B 在 ReAct 基准中超越 GPT-3.5,且具备通过微调进一步提升的潜力。
推荐理由:Hugging Face 发布 smolagents 库并实测开源模型,Mixtral 在 Agent 基准中超越 GPT-3.5。
08:00 Hugging Face Blog 精选AI 评分 66 66 Hugging Face 开源了基于掩码图像建模(MIM)的非扩散文本生成图像模型 aMUSEd。该模型参数量约 8 亿,推理速度快且支持零样本图像修复,已集成至 diffusers 库并提供微调代码。
推荐理由:开源了非扩散架构的图像生成模型及训练代码,为探索高效推理和端侧部署提供了新路径。
08:00 Hugging Face Blog 精选AI 评分 66 66 Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。
推荐理由:TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。
16:00 Mistral AI 发布 Mistral 7B 模型,在多项英文及代码基准上超越 13B 参数模型,以 Apache 2.0 协议开源。该模型推理速度快、成本低,适用于摘要、问答等任务。
推荐理由:Mistral 7B 在多项基准上超越 13B 模型,Apache 2.0 开源,为端侧部署提供高性能替代方案。
16:00 Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA)技术。该模型在 Apache 2.0 协议下开源,在多项基准测试中表现优于 Llama 2 13B,接近 Llama 1 34B 水平,并在代码和推理任务上展现出显著优势。
推荐理由:开源了7.3B参数模型并采用SWA与GQA技术,在多项基准上超越Llama 2 13B,兼顾了性能与推理效率。
08:00 Hugging Face Blog 精选AI 评分 72 72 Hugging Face 发布高效图像生成模型 Würstchen,通过42倍空间压缩实现比 SDXL 更快的推理速度与更低的显存占用。该模型在 Diffusers 库中集成,支持 PyTorch 2.0 SDPA 加速与 torch.compile 优化,并提供多种显存节省策略。
推荐理由:通过42倍极端压缩显著降低训练与推理成本,为资源受限场景提供高效图像生成方案。
08:00 Hugging Face Blog 精选AI 评分 86 86 Meta 发布 Code Llama 系列模型,包含 7B、13B 和 34B 参数版本,基于 Llama 2 在 5000 亿代码 Token 上训练。模型支持代码补全、上下文填充及指令微调,上下文窗口可扩展至 10 万 Token。Hugging Face 提供 Transformers 集成、4-bit 量化加载及生产级推理部署方案。
推荐理由:Meta 发布 Code Llama 系列模型,提供代码补全、生成与指令微调能力,并给出详细的部署与量化指南。
08:00 Hugging Face Blog 精选AI 评分 72 72 Hugging Face 发布开源多模态模型 IDEFICS,复现 DeepMind 未公开的 Flamingo 架构,支持任意图文序列输入并生成文本。模型提供 9B 和 80B 两种参数规模,以及针对对话场景微调的指令版本,基于 LLaMA v1 和 OpenCLIP 构建,使用公开数据及自研 OBELICS 数据集训练。
推荐理由:开源复现 DeepMind Flamingo 架构,提供 9B 和 80B 两种参数规模及指令微调版,支持图文序列输入。
08:00 Hugging Face Blog 精选AI 评分 73 73 Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。
推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。
08:00 Hugging Face Blog 精选AI 评分 95 95 Meta发布Llama 2开源大模型家族,包含7B、13B和70B参数量的预训练及对话微调模型,采用宽松许可允许商用。Hugging Face提供完整集成支持,包括Transformers推理、Inference Endpoints部署及基于PEFT的单卡微调方案。
推荐理由:Meta发布Llama 2并提供Hugging Face集成与微调指南,为开源替代闭源模型提供了具体路径。
08:00 Hugging Face Blog 精选AI 评分 68 68 Hugging Face 发布 AI WebTV 实验性演示,展示了如何结合 Zeroscope 视频生成模型与 MusicGen 音乐模型构建自动化视频直播流。
推荐理由:文章详细拆解了利用Zeroscope和MusicGen构建自动化视频直播的技术架构与代码实现,提供了可复用的工程实践。
08:00 Hugging Face Blog 精选AI 评分 70 70 Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。
推荐理由:原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。
08:00 Hugging Face Blog 精选AI 评分 86 86 阿布扎比技术创新研究所(TII)发布 Falcon-7B 和 Falcon-40B 开源大语言模型,采用 Apache 2.0 协议。Falcon-40B 在 Open LLM Leaderboard 上排名第一,以 2800 PF-days 算力超越 LLaMA-65B。
推荐理由:Falcon 40B 以较低算力成本在基准测试中超越 LLaMA-65B,展示了多查询注意力与 RefinedWeb 数据的高效性。
08:00 Hugging Face Blog 精选AI 评分 70 70 Hugging Face宣布将RWKV架构正式集成至transformers库,该架构结合了RNN的推理效率与Transformer的训练优势。目前提供169M至14B参数的预训练模型及RWKV-4 Raven对话模型,并附带权重转换脚本。
推荐理由:RWKV架构正式集成至Hugging Face transformers库,提供从预训练到Chat微调的多种模型及权重转换工具。
上一页 1 … 5 6 7 8 下一页