Hugging Face 发布 BigCodeBench 编程评测基准
Hugging Face 发布 BigCodeBench 编程评测基准,包含 1140 道涉及 139 个库的函数级任务,并提供开源评测框架与排行榜。
推荐理由:BigCodeBench提供1140道含多库调用的编程题及评测框架,为衡量模型代码生成能力提供新基准。
Hugging Face 发布 BigCodeBench 编程评测基准,包含 1140 道涉及 139 个库的函数级任务,并提供开源评测框架与排行榜。
推荐理由:BigCodeBench提供1140道含多库调用的编程题及评测框架,为衡量模型代码生成能力提供新基准。
Color Health 与 OpenAI 合作推出 Cancer Copilot 应用,利用 GPT-4o 识别缺失诊断并制定个性化检查计划。该工具帮助医疗提供者基于证据做出癌症筛查和治疗决策,加速患者获得治疗。
OpenAI 任命退役美军上将保罗·M·纳卡索尼加入董事会。纳卡索尼将加入董事会的安全与安保委员会,为公司带来网络安全经验。
Hugging Face Accelerate 0.30.0 发布,通过上游 PR 统一了 DeepSpeed 与 PyTorch FSDP 的混合精度处理逻辑。FSDP 现支持“混合精度”与“低精度”两种模式,前者将参数上铸为 fp32 以对齐 DeepSpeed 行为,后者保留 bf16 以节省显存。在四张 A100 GPU 上,两者吞吐量表现相近,MFU 均约为 0.40。
Hugging Face 在 TRL 中引入 RLOO 算法作为 PPO 的替代方案,用于在线 RLHF 训练。该算法将完整回复视为单一动作,显存占用降低 50-70%,训练速度提升 2-3 倍,且在 Pythia 模型上表现优于 DPO。
推荐理由:TRL 引入 RLOO 算法替代 PPO,显著降低显存占用并提升训练速度,为在线 RLHF 提供了更高效的工程方案。
Hugging Face Diffusers 正式支持 Stability AI 发布的 Stable Diffusion 3 Medium (SD3) 模型。该模型包含20亿参数,采用多模态扩散Transformer架构和条件流匹配训练。文章提供了在Diffusers中运行推理、使用显存优化技术以及在A100上实现4倍加速的代码示例,并附带了基于LoRA的微调脚本。
推荐理由:文章详细拆解了SD3 Medium的架构与训练方法,并提供了在Diffusers中运行及微调的具体代码和显存优化方案。
OpenAI与苹果宣布达成合作,计划将ChatGPT整合进苹果的体验中。
推荐理由:OpenAI与苹果宣布合作将ChatGPT整合进苹果生态,为理解两大巨头在端侧AI的协同提供了关键事实。
OpenAI 宣布欢迎 Sarah Friar 担任首席财务官(CFO),Kevin Weil 担任首席产品官(CPO)。
OpenAI 发布文章深入解析其语音引擎(Voice Engine)的技术原理,重点探讨文本转语音模型背后的实现机制。文章同时介绍了公司在该领域开展的安全研究工作,旨在揭示技术细节并说明相关的安全考量。
Hugging Face Embedding Container for Amazon SageMaker 正式发布,AWS 客户可高效部署嵌入模型构建生成式 AI 应用。
Hugging Face 宣布对 Transformers 文档进行全面重构,旨在解决因内容增量式堆叠导致的体验割裂与导航困难问题。新文档将转向以代码和解决方案为导向,并采用更灵活的有机结构替代僵化的分类体系。此举旨在更好地服务于希望将 AI 集成到产品中的开发者群体。
研究团队利用稀疏自编码器扩展新技术,在 GPT-4 的计算中自动识别出 1600 万个模式。
Hugging Face 联合 Artificial Analysis 发布文生图模型榜单与竞技场,基于4.5万人类偏好数据计算 ELO 评分。榜单显示 Midjourney、Stable Diffusion 3 和 DALL·E 3 HD 领先,Playground AI v2.5 等开源模型竞争力增强。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral AI 宣布举办微调黑客松活动,参赛者可使用其新推出的微调 API 进行项目开发。活动时间为 2024 年 6 月 5 日至 30 日,优胜者将获得 2,500 欧元 Mistral API 积分。参与者需通过 La Platforme 注册并添加支付信息以访问 API,部分入选者可获得 100 美元免费积分。
Cubzh 与 Gigax 联合推出 NPC-Playground 演示,用户可在浏览器中体验由 LLM 驱动的 3D 游戏 NPC 交互。该演示基于 Cubzh 引擎和 Gigax 平台,支持通过少量 Lua 脚本为 NPC 赋予新技能。底层模型采用 Phi-3 和 Mistral-7B 微调版本,相关推理栈已开源。
Intel Gaudi 处理器现已在 Optimum Habana 中支持辅助生成技术,可显著降低延迟与功耗。该技术基于投机采样原理,通过小模型生成草稿并由大模型验证,在大型 Transformer 模型上可实现约 2 倍的加速效果。
OpenAI 已终止与隐蔽影响力行动相关的账户。此举旨在遏制 AI 被用于欺骗性用途。公司表示,这些账户并未因 OpenAI 的服务获得显著受众增长。
OpenAI 推出 OpenAI for Education,旨在为高校提供负担得起的 AI 服务,帮助校园负责任地引入人工智能。
OpenAI 推出面向非营利组织的专属计划,旨在提升其工具的可及性。该举措为 ChatGPT Team 和 Enterprise 版本提供折扣费率,以降低非营利机构的使用成本。
MavenAGI 推出基于 GPT-4 构建的 AI 客服智能体,旨在自动化客户服务流程。该智能体已获 Tripadvisor、Clickup 和 Rho 等公司采用,帮助其节省时间并提升客户服务体验。
Mistral 发布首个代码模型 Codestral,这是一个 22B 参数的开源权重生成式 AI 模型,支持 80 多种编程语言和 32k 上下文窗口。该模型提供 HuggingFace 下载及专用 API 端点 codestral.mistral.ai,并已在 LlamaIndex、LangChain 及 VSCode 等开发工具中完成集成。
推荐理由:Mistral 发布首个代码模型 Codestral,提供 22B 开源权重与专用 API 端点,支持 80 多种编程语言及 32k 上下文。
Mistral AI 发布非生产许可证(MNPL),允许开发者用于非商业和研究目的,确保商业使用的公平性。Codestral 率先适用该新许可证,未来 Mistral 将逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:明确了商用与非商用的授权边界,Codestral 率先适用,开发者需据此调整使用策略。
OpenAI 宣布与《大西洋月刊》达成战略合作,将其定位为 OpenAI 产品中的优质新闻来源。《大西洋月刊》的文章将在 ChatGPT 等产品中可供检索,并协助塑造未来实时发现产品的新闻呈现方式。
OpenAI 与 Vox Media 达成多方面协议,Vox Media 的内容将增强 ChatGPT 的输出质量。同时,Vox Media 将基于 OpenAI 的技术开发产品,以更好地服务其受众和广告商。
Hugging Face 推出 TGI Benchmarking 工具,帮助用户超越单一吞吐量指标,通过分析延迟与吞吐量的权衡来优化 Text Generation Inference 部署。该工具提供交互式界面,可直观展示预填充统计、吞吐量与延迟散点图,辅助用户根据业务需求平衡 Time To First Token 与整体性能。
Hugging Face 发布 Sentence Transformers 训练与微调完整指南,详细拆解数据集、损失函数、训练参数、评估器及 Trainer 组件,并提供多数据集混合训练代码示例。
推荐理由:原文拆解了Sentence Transformers训练全流程,提供多数据集混合训练等可复用代码示例。
Meta发布CyberSecEval 2,用于评估大语言模型在代码解释器滥用、提示词注入及网络攻击合规性方面的安全风险。最新评估显示,行业模型协助网络攻击的合规率已从52%降至28%,但提示词注入风险仍未解决。
TII 发布 Falcon 2 系列模型,包含 11B 参数语言模型与视觉语言模型(VLM),均在 5000B tokens 数据上训练。11B LLM 在多项基准上超越 Llama3-8B 和 Mistral-7B,支持 11 种语言;11B VLM 集成 CLIP 视觉编码器,在 MME 等基准上表现优异。模型采用 Apache 2.0 衍生许可开源。
推荐理由:Falcon 2 提供 11B 参数语言模型与视觉语言模型,兼顾多语言与代码能力,为端侧部署提供高性价比选择。
OpenAI 与 News Corp 达成多年全球合作伙伴关系,旨在通过优质新闻内容丰富 OpenAI 的生成式 AI 产品和平台。
Hugging Face Inference Endpoints 新增 AWS Inferentia2 实例支持,覆盖超十万模型并提供 OpenAI SDK 兼容接口。
OpenAI 发布其安全实践文档,强调在开发人工智能时必须负责任地进行部署。文章指出,通用人工智能有潜力惠及生活的方方面面,因此必须确保其发展过程的安全性与责任感。
Hugging Face 宣布与 AMD 合作,在 Hugging Face Platform 中为 AMD Instinct MI300 提供原生支持,无需代码修改即可在 Azure ND MI300x V5 VM 上运行。
推荐理由:Hugging Face 官方发布 AMD MI300 深度集成方案,提供实测推理与微调性能数据,为开发者提供可迁移的部署参考。
Dell Enterprise Hub 在 Hugging Face 上线,提供预优化容器,让用户能在 Dell 平台上轻松在本地训练和部署开源大语言模型。该工具内置 Llama 3、Mixtral 和 Gemma 等模型,支持通过脚本一键部署为 API 端点,并允许使用 CSV 或 JSONL 格式数据在本地安全环境中进行微调。
Hugging Face Spaces 推出 Dev Mode 功能,允许用户通过 VS Code 或 SSH 直接连接并编辑 Space 代码。该功能目前处于 Beta 阶段,仅对 PRO 订阅用户开放,旨在消除使用 git 推送本地更改的需求,实现更无缝的开发体验。
Hugging Face 与微软宣布深化战略合作,在 Azure Model Catalog 的 Hugging Face Collection 中新增 Llama 3、Mistral 7B 等热门开源大模型,支持一键部署。双方还基于 AMD MI300X GPU 优化了模型性能,并推出 Spaces Dev Mode 以改善开发者在 VS Code 中的体验。
ChatGPT 语音由专业选角和导演团队从 400 多份投稿中筛选出 5 个最终版本。
ChatGPT 更新数据分析功能,支持直接添加 Google Drive 和 Microsoft OneDrive 文件,并增强与表格和图表的交互能力。
推荐理由:ChatGPT 新增云端文件直传与图表交互能力,扩展了多模态处理范围。
OpenAI 宣布与 Reddit 达成合作,计划将 Reddit 的独特内容引入 ChatGPT 及其产品。
推荐理由:OpenAI 官方宣布与 Reddit 达成合作,将 Reddit 内容引入 ChatGPT,为理解大模型数据源拓展提供了直接依据。
Hugging Face 在 Transformers 库中集成 KV Cache 量化功能,支持 int2 至 int4 精度,可显著降低长上下文生成的显存占用。实验显示 int4 精度在保持模型质量的同时,相比 fp16 可实现约 2.5 倍的显存节省,在 80GB A100 上支持最高 128k tokens 上下文。
推荐理由:官方在 Transformers 中集成 KV Cache 量化功能,提供 int2 至 int4 精度选项,显著降低长文本生成的显存占用。