Sora System Card
OpenAI 发布 Sora System Card,介绍其视频生成模型 Sora。该模型支持文本、图像和视频输入,可生成新视频。Sora 基于 DALL-E 和 GPT 模型的学习成果,旨在为用户提供更丰富的故事讲述和创意表达工具。
OpenAI 发布 Sora System Card,介绍其视频生成模型 Sora。该模型支持文本、图像和视频输入,可生成新视频。Sora 基于 DALL-E 和 GPT 模型的学习成果,旨在为用户提供更丰富的故事讲述和创意表达工具。
电影制作组合 Vallée Duhamel 解释了 Sora 如何帮助构建新世界。
OpenAI 发布 ChatGPT Pro,旨在扩大前沿 AI 的使用范围。
OpenAI 发布 o1 System Card,详述 o1 和 o1-mini 发布前的安全工作,包括外部红队测试及基于 Preparedness Framework 的前沿风险评估。
Google 发布 PaliGemma 2 视觉语言模型,基于 SigLIP 和 Gemma 2 架构,提供 3B、10B 和 28B 三种参数规模,支持 224x224、448x448 和 896x896 多种输入分辨率。模型采用 Gemma 许可协议,支持商业使用与微调,Hugging Face 同步更新了 transformers 集成与 LoRA 微调脚本。
推荐理由:提供了多尺寸模型与多分辨率支持,并附带微调脚本,便于开发者快速适配视觉语言任务。
该实验利用 Keras 和 TPUs 构建 Chatbot Arena,测试 LLM 在代码生成中根据自然语言反馈修正错误的能力。实验在 TPU v5e 上同时加载 7 个模型,包括 5 个约 8B 参数和 3 个约 2B 参数的大语言模型。结果显示,LLM 能否有效修复错误取决于其推理可靠性。
OpenAI 与专业媒体平台 Future 宣布建立战略合作伙伴关系。该合作旨在将 Future 旗下 200 多个媒体品牌的内容引入 OpenAI 的用户群体。
摩根士丹利正在利用 AI 评估(AI evals)来塑造金融服务的未来。
AraGen Benchmark 发布,推出基于 3C3H 评估框架的阿拉伯语 LLM 排行榜。该框架通过 LLM-as-a-Judge 从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度综合评估模型的事实准确性与可用性。排行榜采用动态评估策略,数据集每三个月轮换一次以防范数据污染。
Capital Fund Management 利用 Llama 3.1 辅助标注和 Argilla 平台优化金融数据命名实体识别,将 GLiNER 和 SpanMarker 微调后 F1 分数分别提升至 93.4% 和 90.1%。该方案推理成本较大型 LLM 降低高达 80 倍,实现了准确性与成本效益的平衡。
Hugging Face发布指南解读欧盟AI法案对开源开发者的合规要求,涵盖有限风险AI系统的披露义务及非系统性风险GPAI模型的训练数据摘要与版权合规,并推荐了平台上的相关工具。
推荐理由:文章梳理了欧盟AI法案对开源开发者的合规要求,并提供了Hugging Face平台上的实用工具指引。
Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。
Hugging Face 发布 SmolVLM,一款 2B 参数、完全开源的视觉语言模型。该模型采用像素重排策略将视觉信息压缩 9 倍,在同等规模下显存占用最低且推理速度最快。提供 Base、Synthetic 和 Instruct 三个版本,支持本地部署与微调。
推荐理由:SmolVLM 通过像素重排策略大幅压缩视觉 Token,在同等规模下实现更低的显存占用和更高的推理速度。
本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。
OpenAI 发布文章探讨如何通过人与 AI 协作推进红队测试。该文章分析了结合人类专家判断与人工智能能力以增强模型安全评估的方法。此举旨在提升对大语言模型潜在风险的识别与缓解能力。
OpenAI 通过 GPT-4o 视觉微调技术,提升了地图构建的智能化水平。该方法利用 GPT-4o 的视觉能力优化地图数据,旨在提供更准确、更智能的地图服务体验。
Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。
推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。
Hugging Face 与 LLM-jp 联合发布开放日语大语言模型排行榜,旨在填补日语模型评估空白。该排行榜包含 20 多个数据集,涵盖自然语言推理、代码生成、数学推理等 16 项任务。此举旨在促进透明度并鼓励开源模型开发。
BAAI FlagEval 推出多语言大模型辩论竞技场,支持中英阿韩四语对抗,引入专家与用户双轨评估机制。o1-preview、GPT-4o、Claude-3.5-sonnet 等已参与,实验显示该模式能更显著区分模型推理与逻辑差异。
推荐理由:平台引入多语言对抗辩论与专家双轨评估,为模型推理能力提供更细粒度的差异化评测。
Rox 宣布全面采用 OpenAI 的模型技术。该平台通过结合商业经验与大语言模型专业知识,旨在利用 OpenAI 的模型能力,帮助每一位卖家跻身前 1% 的顶尖行列。
Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。平台包含 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 和 Qwen 2.5 等模型,结果显示 GPT-4 Turbo 暂居榜首,Qwen 2.5 7B 和 Llama 3.1 8B 等小模型表现优异。
推荐理由:Hugging Face 推出 Judge Arena 平台,通过众包投票对比 18 款主流模型作为评估者的表现。
Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。
推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。
Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。
推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。
雅诗兰黛集团使用 ChatGPT Enterprise 和自定义 GPT 分析消费者数据并挖掘洞察。这一举措旨在加速美容领域的创新进程。
Hugging Face Hub 提供海量存储与流式读取功能,支持 TB 级数据集托管。平台内置 Datasets Viewer 与 SQL Console,支持全文搜索、排序及 DuckDB 语法查询。数据集可无缝对接 Pandas、Polars 等主流库,并提供公开、私有及 Gated 访问控制。
Mistral 在 La Plateforme 推出批量 API,处理高体积请求成本比同步 API 降低 50%。该功能适用于客户反馈分析、文档批量摘要及向量化等场景,单工作区限制 100 万并发请求。
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
PyCharm Professional 推出 Hugging Face 集成,支持在 IDE 内直接插入模型代码并查看 Model Card。该功能允许开发者快速调用如 microsoft/Phi-3.5-vision-instruct 等多模态模型,并管理本地模型缓存。
Argilla 2.4 发布,支持无需代码即可在 Hugging Face Hub 上构建微调与评估数据集。用户可通过 UI 直接导入公开 Hub 数据集,自动建议初始配置并收集人类反馈。该功能旨在降低数据标注门槛, democratize 高质量数据集的创建。
OpenAI 推出 ChatGPT 搜索功能,旨在提供带有相关网页来源链接的快速、实时答案。
推荐理由:ChatGPT 新增搜索功能,提供带有来源链接的快速实时回答,可据此评估其对现有搜索场景的替代潜力。
Promega 自上而下采用 ChatGPT,加速了制造、销售和营销流程。
OpenAI 发布 SimpleQA,这是一个用于衡量语言模型回答简短事实性问题能力的基准测试。该基准专注于评估模型在事实准确性方面的表现。
Decagon 与 OpenAI 合作交付高性能、全自动的规模化客户支持方案。该方案实现了客服流程的完全自动化,旨在满足大规模业务场景下的高性能需求。
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
Digital Green 在 Hugging Face 专家支持下,基于 GARDIAN 知识库开发 Farmer.chat 农业问答机器人。系统采用 RAG 架构,由 GPT-4o 驱动规划智能体,通过向量数据库检索并生成回答。团队引入 LLM-as-a-Judge 技术,对模型输出的准确性、简洁性等指标进行自动化评估,以解决缺乏确定性评测标准的问题。
Cohere For AI 发布 Aya Expanse 系列多语言大语言模型,包含 8B 和 32B 参数版本,并在 Hugging Face 开源权重。
推荐理由:Aya Expanse 通过数据套利与模型融合等创新训练策略,在多项多语言评测中超越 Llama 3.1 等主流模型,为多语言大模型训练提供了新的技术路径。
OpenAI 发布研究,展示了简化、稳定并扩展连续时间一致性模型的方法,在仅使用两步采样的情况下实现了与领先扩散模型相当的样本质量。
推荐理由:研究展示了连续时间一致性模型在两步采样下达到主流扩散模型画质,为高效图像生成提供新路径。
Hugging Face 发布 HUGS,基于 TGI 的零配置推理微服务,支持 Llama 3.1 等 13 款开源模型。提供 OpenAI 兼容 API,可在 AWS、GCP 及 DigitalOcean 部署,按容器运行时间计费。
推荐理由:提供零配置推理微服务,支持主流开源模型与多硬件,降低私有化部署门槛。
Hugging Face 发布 CinePile 2.0,这是基于对抗性数据优化方法显著改进的长视频问答数据集。该数据集包含约 30 万个训练样本和 5000 个测试样本,通过引入对抗性数据优化流程,有效提升了问题的多样性与难度。
Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。
推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。