OpenAI 打造 AI 驱动 Magic Studio
OpenAI 推出 AI 驱动的 Magic Studio。该工具旨在赋能 Canva 平台,帮助缺乏设计训练的知识工作者利用其易用界面和丰富资源库,高效制作演示文稿、视频及社交媒体图形等视觉内容。
OpenAI 推出 AI 驱动的 Magic Studio。该工具旨在赋能 Canva 平台,帮助缺乏设计训练的知识工作者利用其易用界面和丰富资源库,高效制作演示文稿、视频及社交媒体图形等视觉内容。
OpenAI宣布Ilya Sutskever将离开公司,Jakub Pachocki被任命为首席科学家。
推荐理由:原文确认了首席科学家的交接,读者可据此了解OpenAI高层人事变动的具体安排。
Hugging Face 与 LangChain 联合发布 langchain-huggingface 官方包,解决此前社区维护导致的更新滞后问题。
推荐理由:官方联合维护解决社区维护滞后问题,提供本地与云端两种接入方式,便于开发者快速集成最新模型。
Open Arabic LLM Leaderboard (OALL) 正式上线,旨在评估和比较阿拉伯语大语言模型的性能。该榜单利用 AlGhafa、ACVA 和 AceGPT 等数据集,采用标准化对数似然准确率作为核心评估指标。技术架构基于 lighteval 库,并支持社区提交模型参与排名。
Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。
推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。
OpenAI 发布 GPT-4 Omni 旗舰模型,支持在音频、视觉和文本之间进行实时推理。
推荐理由:GPT-4 Omni 支持实时跨音频、视觉和文本推理,为多模态交互提供了新的技术基准。
OpenAI 发布 GPT-4o 模型,并宣布在 ChatGPT 中提供更多免费能力。
推荐理由:GPT-4o 发布并开放 ChatGPT 免费使用,读者可据此评估多模态模型在通用场景的可用性。
OpenAI 发布最新旗舰模型 GPT-4o,并宣布在 ChatGPT 免费用户中开放更多功能。
推荐理由:GPT-4o 作为最新旗舰模型上线,同时 ChatGPT 免费用户获得更多功能,直接改变免费用户的可用能力边界。
Hugging Face 将 Transformers Agents 升级为独立库 smolagents,引入支持基于过往观察进行迭代的 ReactAgent 新架构。使用 Llama-3-70B-Instruct 驱动的多模态 Agent 在 GAIA 基准测试中排名第四,超越了多个基于 GPT-4 的 Agent。
推荐理由:Hugging Face 发布独立 Agent 库,提供可迭代的新架构,开源模型在 GAIA 基准上表现超越 GPT-4。
Intel 结合 Gaudi 2 加速器和 Xeon CPU,通过 OPEA 平台与 LangChain 框架,展示了构建企业级 RAG 应用的方法。其中嵌入模型运行于 Granite Rapids CPU,LLM 运行于 Gaudi 2,并支持通过 TGI 部署 Llama 等模型。测试显示,启用 FP8 量化相比 BF16 可获得 1.8 倍的吞吐量提升。
Hugging Face 允许用户通过 AWS Marketplace 将组织升级为 Enterprise Hub,以获取高级安全与协作功能。该方案支持单点登录、资源组权限管理、GDPR 合规存储及审计日志,并提供 NVIDIA DGX Cloud 训练选项。订阅后账单由 AWS 账户统一管理,价格与公开定价一致。
OpenAI 发布其数据与 AI 方法,指出 AI 正在改变生活、工作和学习方式,并引发关于 AI 时代数据的讨论。公司同时推出面向创作者和内容所有者的新 Media Manager,并阐述了未来发展方向。
OpenAI 推出新技术帮助研究人员识别由其工具生成的内容,并加入 Coalition for Content Provenance and Authenticity 指导委员会以推动行业标准。
OpenAI 与 Stack Overflow 宣布建立新的 API 合作伙伴关系。该合作旨在结合全球领先的技术知识平台与最受欢迎的 LLM 模型,为 AI 开发赋能开发者。
Hugging Face 推出专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评估空白。该榜单包含希伯来语问答、情感准确性、Winograd Schema 挑战及翻译四项基准测试,采用 few-shot 提示格式评估模型。模型通过 HuggingFace Inference Endpoints 自动部署,由 lighteval 库管理 API 请求进行评测。
Artificial Analysis 的 LLM Performance Leaderboard 正式登陆 Hugging Face,提供涵盖质量、价格与速度的综合指标。
OpenAI 封禁了与伊朗起源的 "IUVM" 行动相关的账户,该行动利用 AI 生成并翻译亲伊朗、反以色列和反美国的内容。
OpenAI 封禁了与源自中国的“Spamouflage”影响力活动相关的账户。该活动利用 AI 研究社交媒体动态、生成帖子,并调试一个此前未披露的网站。
OpenAI 封禁了与名为“零芝诺”的以色列关联影响力行动相关的账号。该行动利用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党及亲工会的内容。
Hugging Face 博客发布教程,展示如何通过自定义推理处理器在 Inference Endpoints 上部署模块化语音识别服务。该方案结合 OpenAI Whisper 与 Pyannote 模型实现说话人分离,并引入推测解码加速推理。基准测试显示,在短音频且 batch size 为 1 时,推测解码可带来显著性能提升。
推荐理由:提供了结合 Whisper 与 Pyannote 的完整代码,展示了如何在 Inference Endpoints 上部署带说话人分离和推测解码的语音识别服务。
OpenAI 封禁了与俄罗斯起源的“替身”(Doppelganger)行动相关的账户。该行动利用 AI 生成针对乌克兰的反动社交媒体评论、翻译及网站文案,涉及多种语言。
OpenAI 封禁了与名为“Bad Grammar”的俄罗斯关联行动相关的账号。该行动利用 AI 生成关于乌克兰、摩尔多瓦、波罗的海及美国政治的英语和俄语 Telegram 评论。
Hugging Face 与 Dottxt 联合研究指出,LLM 评测结果对提示词格式高度敏感,微小变化可导致模型排名波动。通过 Outlines 库引入结构化生成约束输出,在 GSM8K 和 GPQA 任务中显著降低了性能方差,提升了不同提示词设置下模型排名的稳定性。
OpenAI 宣布将《金融时报》(Financial Times)的世界级新闻内容引入 ChatGPT。双方还将合作为 FT 读者开发新的 AI 体验。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全透明且许可自由的自对齐管道训练的代码大语言模型。该模型仅使用 StarCoder2-15B 自身生成的指令-响应对进行微调,无需人工标注或闭源模型蒸馏数据。
推荐理由:模型采用完全自生成的指令微调数据,在编码基准上超越部分闭源模型,提供了可复用的自对齐方法。
OpenAI 宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。
推荐理由:OpenAI 官方宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。
OpenAI 宣布致力于加速救命疗法的开发。
OpenAI 宣布 GPT-4 API 正式全面可用,同时 GPT-3.5 Turbo、DALL·E 和 Whisper API 也实现全面可用。公司发布了旧版 Completions API 模型的停用计划,这些模型将于 2024 年初退役。
OpenAI 为 API 客户推出更多企业级功能,旨在增强企业支持。此次更新包括增加更多安全功能与控制选项,对 Assistants API 进行改进,并提供用于更好管理成本的工具。
Hugging Face 发布 Open Chain of Thought Leaderboard,通过对比有无思维链提示的准确率差异来评估大语言模型的推理能力。该榜单基于 LogiQA 和 LSAT 数据集,采用 Classic 和 Reflect 两种提示策略生成推理轨迹,旨在更稳健地衡量模型在复杂逻辑任务中的思维链生成效果。
Hugging Face 发布 Jack of All Trades (JAT),这是一个基于 Transformer 架构的多用途通用智能体项目。JAT 模型在 Atari 57、BabyAI、Meta-World 和 MuJoCo 等 157 个任务上平均达到专家性能的 65.8%,并在 21 个 Atari 游戏中超越人类水平。该项目同时开源了包含数十万专家轨迹的 JAT 数据集及模型。
OpenAI 发布“指令层级”方法,训练大语言模型优先执行特权指令,以抵御提示注入和越狱等攻击。该技术旨在解决当前模型易受恶意提示覆盖原始指令的安全隐患,提升模型在对抗环境下的指令遵循能力。
Hugging Face 发布 Open Medical-LLM Leaderboard,旨在通过标准化平台评估和比较大型语言模型在医疗任务中的表现。该基准测试涵盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医疗子集,以准确率作为主要评估指标。测试结果显示 GPT-4-base 和 Med-PaLM-2 等商业模型在多个医疗数据集上表现优异。
Hugging Face 宣布 Meta 开源大模型 Llama 3 正式上架,提供 8B 和 70B 两种参数规模及基础与指令微调版本,并同步发布安全模型 Llama Guard 2。文章详细介绍了 Llama 3 在训练数据、上下文窗口和 Tokenizer 方面的升级,并给出了基于 Transformers 进行推理、量化部署及 TRL 微调的具体代码示例。
推荐理由:Hugging Face 提供了从模型下载、量化部署到微调的完整技术路径,帮助开发者快速接入 Llama 3。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Ryght 正式发布面向医疗与生命科学领域的企业级生成式 AI 平台 Ryght Preview。该平台集成 Hugging Face 的 Text Generation Inference (TGI) 和 Text Embeddings Inference (TEI) 服务,支持灵活接入多种大语言模型。Ryght Preview 现已作为免费、安全的平台向生命科学知识工作者公开可用。
Hugging Face 上线 LiveCodeBench Leaderboard,基于 UC Berkeley 等机构开发的 LiveCodeBench 基准,提供防污染的时间窗口评测。该基准涵盖代码生成、自我修复、代码执行和测试输出预测四个场景,采用 Pass@1 指标,并支持通过 GitHub 仓库提交模型结果。
Zama 团队利用全同态加密技术,在 Hugging Face Endpoints 上部署了 Concrete ML 隐私保护机器学习模型。用户可通过一键部署预编译模型,在 CPU 上直接对加密数据进行推理,无需接触明文数据。示例中决策树模型在 691 个样本上准确率达 0.8958,单次推理耗时约 4.123 秒。
Gradio 推出 Reload Mode,在修改源码后无需重启服务器即可自动加载最新更改,显著缩短开发迭代周期。该模式通过自定义重载逻辑,避免重新加载大模型或连接数据库带来的延迟,并支持使用 `gr.NO_RELOAD` 标记不重载代码。结合 Hugging Face Inference API,开发者可快速构建文档分析等多模态应用。
Hugging Face 发布 Idefics2,一款基于 Mistral-7B 和 SigLIP 的 8B 参数开源多模态模型,采用 Apache 2.0 许可证。
推荐理由:开源8B多模态模型在多项基准上超越更大参数模型,提供完整权重与微调数据集,降低多模态应用门槛。