Hugging Face Dataset Hub 新增 Dataset Search 四大筛选功能
Hugging Face 宣布 Dataset Hub 的 Dataset Search 新增按模态、数据量、格式和兼容库筛选功能。用户可通过 Text、Image 等模态、行数范围、Parquet 等格式及 Pandas 等库过滤数据集。这些筛选器可与语言、任务等现有过滤器组合使用,提升数据集发现效率。
Hugging Face 宣布 Dataset Hub 的 Dataset Search 新增按模态、数据量、格式和兼容库筛选功能。用户可通过 Text、Image 等模态、行数范围、Parquet 等格式及 Pandas 等库过滤数据集。这些筛选器可与语言、任务等现有过滤器组合使用,提升数据集发现效率。
Intel 与 MILA 将 ProtST 蛋白质语言模型部署至 Intel Gaudi 2 加速器,实现高效推理与微调。在 ProtST-SubcellularLocalization 数据集上,Gaudi 2 推理速度较 NVIDIA A100 快 1.76 倍,准确率持平。微调任务中,单卡 Gaudi 2 速度提升 2.92 倍,且 4 或 8 卡分布式训练呈现近线性扩展。
Hugging Face 发布独立库 smolagents,其前身 Transformers Agents 基于 Code Agent 在 GAIA 基准测试验证集上取得 44.2% 的成绩排名第一。该方案通过代码执行、安全解释器及多智能体编排,展示了代码动作在复杂任务中的优势。
推荐理由:文章分享了基于代码智能体在GAIA基准测试中取得高分的技术细节,为构建复杂Agent系统提供了可迁移的实践经验。
CriticGPT 是一个基于 GPT-4 的模型,用于撰写 ChatGPT 回复的评论,帮助人类训练师在强化学习人类反馈(RLHF)过程中发现错误。
OpenAI 与 TIME 达成战略合作,利用其 101 年的档案内容优化模型回复质量。该合作旨在增强回答准确性,并向用户直接提供 Time.com 上的故事链接。
Google 发布 Gemma 2 开源大语言模型,包含 9B 和 27B 两种参数规模。该模型在训练数据量、滑动窗口注意力、Logit 软截断及知识蒸馏等方面进行了技术升级,并在多项基准测试中表现优异。Hugging Face 已提供 Transformers 集成、微调工具及推理端点支持。
推荐理由:文章详细拆解了Gemma 2的技术改进与生态集成,为开发者评估和部署提供了具体参考。
XLSCOUT 发布专利专用嵌入模型 ParaEmbed 2.0,在 Hugging Face 专家支持下,通过微调专利数据使准确率较 1.0 版本提升 23%。
高质量数据是AI系统产生优质输出的基础,其核心在于数据必须适配特定用途。数据质量的关键维度包括相关性、全面性、时效性以及偏见缓解。重视数据质量能提升模型性能、鲁棒性、效率及公平性,并支持有效的AI治理与科学可复现性。
Hugging Face 博客发布教程,展示如何在受限资源下微调 Microsoft Florence-2 视觉语言模型。文章通过 DocVQA 数据集实验,验证了冻结视觉编码器并使用小学习率(1e-6)微调的有效性,验证集 Levenshtein 相似度从 0 提升至 57.0,并提供了 Colab 笔记本与完整代码。
推荐理由:提供在受限资源下微调 Florence-2 的完整代码与实验数据,展示如何将其适配至文档问答等下游任务。
OpenAI 宣布收购 Rockset。此次收购旨在增强 OpenAI 在实时数据处理与向量搜索方面的能力,以支持其 AI 应用的底层基础设施需求。
OpenAI 推出网络安全资助计划,旨在通过支持创新研究和人工智能集成来赋能网络安全防御者。该计划重点资助将 AI 技术整合到网络安全领域的创新项目,以提升整体防御能力。
OpenAI 提出一种整体方法,旨在构建用于现实世界内容审核的鲁棒且实用的自然语言分类系统。该方法致力于提升非期望内容检测的准确性与实用性,以应对真实场景中的复杂挑战。
OpenAI 发布改进的一致性模型训练技术。一致性模型是一类新兴的生成模型,无需对抗训练即可在单步采样中生成高质量数据。
Hugging Face 联合 Argilla 发起 Data Is Better Together 倡议,推动开源社区协作构建高质量数据集。社区已完成包含 10K 提示词的 DIBT/10k_prompts_ranked 数据集及多语言评估项目,并发布了 DPO/ORPO 和 KTO 等数据集构建指南。目前该计划仍在持续招募贡献者以完善多语言及特定领域资源。
一致性模型(Consistency Models)旨在解决扩散模型依赖迭代采样导致生成速度慢的问题。扩散模型虽在图像、音频和视频生成领域取得显著进展,但其迭代过程限制了生成效率。
Prezi 加入 Hugging Face 专家支持计划,加速多模态机器学习路线图。其旗舰产品 Prezi AI 结合图像和文本,通过引入开源重排模型优化资产搜索,实现更便宜、快速且准确的演示生成。专家指导帮助非机器学习工程师团队筛选视觉语言模型,并利用 Inference Endpoints 便捷部署,显著提升开发效率。
Paf 在全公司范围采用 ChatGPT Enterprise,工程师日常使用自定义 GPT 加速常规开发任务。该公司还将 ChatGPT Enterprise 集成至 grit:lab 编程学院,以 AI 增强、系统架构思维培养新一代软件开发者。目前 70% 的 Paf 员工(涵盖财务、HR、营销及客服等业务团队)活跃使用该服务。
Hugging Face 发布 BigCodeBench 编程评测基准,包含 1140 道涉及 139 个库的函数级任务,并提供开源评测框架与排行榜。
推荐理由:BigCodeBench提供1140道含多库调用的编程题及评测框架,为衡量模型代码生成能力提供新基准。
Color Health 与 OpenAI 合作推出 Cancer Copilot 应用,利用 GPT-4o 识别缺失诊断并制定个性化检查计划。该工具帮助医疗提供者基于证据做出癌症筛查和治疗决策,加速患者获得治疗。
OpenAI 任命退役美军上将保罗·M·纳卡索尼加入董事会。纳卡索尼将加入董事会的安全与安保委员会,为公司带来网络安全经验。
Hugging Face Accelerate 0.30.0 发布,通过上游 PR 统一了 DeepSpeed 与 PyTorch FSDP 的混合精度处理逻辑。FSDP 现支持“混合精度”与“低精度”两种模式,前者将参数上铸为 fp32 以对齐 DeepSpeed 行为,后者保留 bf16 以节省显存。在四张 A100 GPU 上,两者吞吐量表现相近,MFU 均约为 0.40。
Hugging Face 在 TRL 中引入 RLOO 算法作为 PPO 的替代方案,用于在线 RLHF 训练。该算法将完整回复视为单一动作,显存占用降低 50-70%,训练速度提升 2-3 倍,且在 Pythia 模型上表现优于 DPO。
推荐理由:TRL 引入 RLOO 算法替代 PPO,显著降低显存占用并提升训练速度,为在线 RLHF 提供了更高效的工程方案。
Hugging Face Diffusers 正式支持 Stability AI 发布的 Stable Diffusion 3 Medium (SD3) 模型。该模型包含20亿参数,采用多模态扩散Transformer架构和条件流匹配训练。文章提供了在Diffusers中运行推理、使用显存优化技术以及在A100上实现4倍加速的代码示例,并附带了基于LoRA的微调脚本。
推荐理由:文章详细拆解了SD3 Medium的架构与训练方法,并提供了在Diffusers中运行及微调的具体代码和显存优化方案。
OpenAI与苹果宣布达成合作,计划将ChatGPT整合进苹果的体验中。
推荐理由:OpenAI与苹果宣布合作将ChatGPT整合进苹果生态,为理解两大巨头在端侧AI的协同提供了关键事实。
OpenAI 宣布欢迎 Sarah Friar 担任首席财务官(CFO),Kevin Weil 担任首席产品官(CPO)。
OpenAI 发布文章深入解析其语音引擎(Voice Engine)的技术原理,重点探讨文本转语音模型背后的实现机制。文章同时介绍了公司在该领域开展的安全研究工作,旨在揭示技术细节并说明相关的安全考量。
Hugging Face Embedding Container for Amazon SageMaker 正式发布,AWS 客户可高效部署嵌入模型构建生成式 AI 应用。
Hugging Face 宣布对 Transformers 文档进行全面重构,旨在解决因内容增量式堆叠导致的体验割裂与导航困难问题。新文档将转向以代码和解决方案为导向,并采用更灵活的有机结构替代僵化的分类体系。此举旨在更好地服务于希望将 AI 集成到产品中的开发者群体。
研究团队利用稀疏自编码器扩展新技术,在 GPT-4 的计算中自动识别出 1600 万个模式。
Hugging Face 联合 Artificial Analysis 发布文生图模型榜单与竞技场,基于4.5万人类偏好数据计算 ELO 评分。榜单显示 Midjourney、Stable Diffusion 3 和 DALL·E 3 HD 领先,Playground AI v2.5 等开源模型竞争力增强。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral AI 宣布举办微调黑客松活动,参赛者可使用其新推出的微调 API 进行项目开发。活动时间为 2024 年 6 月 5 日至 30 日,优胜者将获得 2,500 欧元 Mistral API 积分。参与者需通过 La Platforme 注册并添加支付信息以访问 API,部分入选者可获得 100 美元免费积分。
Cubzh 与 Gigax 联合推出 NPC-Playground 演示,用户可在浏览器中体验由 LLM 驱动的 3D 游戏 NPC 交互。该演示基于 Cubzh 引擎和 Gigax 平台,支持通过少量 Lua 脚本为 NPC 赋予新技能。底层模型采用 Phi-3 和 Mistral-7B 微调版本,相关推理栈已开源。
Intel Gaudi 处理器现已在 Optimum Habana 中支持辅助生成技术,可显著降低延迟与功耗。该技术基于投机采样原理,通过小模型生成草稿并由大模型验证,在大型 Transformer 模型上可实现约 2 倍的加速效果。
OpenAI 已终止与隐蔽影响力行动相关的账户。此举旨在遏制 AI 被用于欺骗性用途。公司表示,这些账户并未因 OpenAI 的服务获得显著受众增长。
OpenAI 推出 OpenAI for Education,旨在为高校提供负担得起的 AI 服务,帮助校园负责任地引入人工智能。
OpenAI 推出面向非营利组织的专属计划,旨在提升其工具的可及性。该举措为 ChatGPT Team 和 Enterprise 版本提供折扣费率,以降低非营利机构的使用成本。
MavenAGI 推出基于 GPT-4 构建的 AI 客服智能体,旨在自动化客户服务流程。该智能体已获 Tripadvisor、Clickup 和 Rho 等公司采用,帮助其节省时间并提升客户服务体验。
Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。
推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。
Mistral AI 发布非生产许可证(MNPL),允许开发者用于非商业和研究目的,确保商业使用的公平性。Codestral 率先适用该新许可证,未来 Mistral 将逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:明确了商用与非商用的授权边界,Codestral 率先适用,开发者需据此调整使用策略。