OpenAI 关于用户遭遇心理或情绪困扰时的安全考量
OpenAI 阐述了在用户遭遇心理或情绪困扰时的安全设计思路,分析了当前系统的局限性,并介绍了正在进行的优化工作。
OpenAI 阐述了在用户遭遇心理或情绪困扰时的安全设计思路,分析了当前系统的局限性,并介绍了正在进行的优化工作。
OpenAI 与 Retro Bio 合作,利用专用 AI 模型 GPT-4b micro 协助设计更有效的蛋白质,用于干细胞疗法和长寿研究。该模型在生命科学领域的应用展示了加速研发进程的能力。
Blue J 凭借专注度、领域深度及合适的 OpenAI 模型,成功扩展至三个国家并服务超过 3,000 家律所。这一成果展示了在复杂且受监管的领域内,通过聚焦核心优势与利用先进 AI 技术实现规模化增长的有效路径。
NVIDIA 发布 Nemotron Nano 2 9B 模型及 Nemotron Post-Training Dataset v2。数据集包含 600 万条翻译为法语、西班牙语、德语、意大利语和日语的推理数据,保留英文推理链。Nemotron Nano 2 采用混合 Transformer-Mamba 架构,支持配置思考预算以节省推理成本,模型权重已在 Hugging Face 开源。
推荐理由:NVIDIA 同步开源多语言推理数据集与端侧推理模型,提供可配置思考预算的混合架构方案。
日本数字娱乐与生活服务平台领导者 Mixi 采用 ChatGPT Enterprise,旨在重塑团队沟通方式。该方案帮助 Mixi 提升生产力,推动 AI 在团队中的广泛采用,并构建安全的创新环境。
通过 MCP 将 Claude 接入 Hugging Face Spaces,可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。FLUX.1 Krea [dev] 擅长消除 AI 痕迹,生成具有自然光照和真实质感的图片。Qwen-Image 则具备强大的提示词遵循能力和准确的文本渲染效果,适合制作海报等含文字的设计。
DoorDash 首席人力官 Mariana Garavaglia 分享了公司如何规模化应用 AI,以赋能员工更快构建、学习和创新。
Hugging Face 发布 Research Tracker MCP 工具,允许 AI 智能体通过自然语言自动化跨 arXiv、GitHub 和 Hugging Face 的文献发现流程。该工具将手动搜索和脚本工具封装为 MCP 标准接口,支持 Claude Desktop、Cursor 等客户端直接调用,简化了论文、代码和模型的交叉检索。
Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。
推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。
Hugging Face开源了Kimina-Prover-RL,一个基于Verl框架的Lean 4形式化定理证明训练管线,并发布了1.7B和0.6B两个模型。该管线采用类DeepSeek-R1的结构化推理范式,结合格式奖励和错误纠正机制,在MiniF2F基准上刷新了开源模型在对应参数规模下的SOTA成绩。
推荐理由:开源了基于Verl的Lean 4定理证明训练管线及0.6B和1.7B模型,为小参数模型形式化推理提供了可复现的SOTA方案。
ExecuTorch 0.7 beta 发布,默认启用 KleidiAI 加速,利用 Arm SDOT 指令集为旧款手机和树莓派等设备提供开箱即用的端侧推理性能。
推荐理由:ExecuTorch 0.7 默认启用 KleidiAI 并支持旧款设备,为端侧推理提供了开箱即用的性能优化方案。
Arm 发布 Neural Super Sampling (NSS),一款专为移动端 GPU 神经网络加速器优化的实时时序超采样模型。在演示中,NSS 将 540p 渲染结果在 4ms 内超采样至 1080p,并降低 50% GPU 负载。该模型已集成至 Unreal Engine 插件及 Vulkan ML 扩展,供开发者在移动游戏和 XR 场景中实验。
Basis 的 AI 智能体基于 OpenAI o3、o3-Pro、GPT-4.1 和 GPT-5 构建,帮助会计师事务所节省高达 30% 的时间,并扩展咨询与增长能力。
Hugging Face 发布 FilBench,系统评估 LLM 在 Tagalog、Filipino 和 Cebuano 等菲律宾语言上的表现。评测涵盖文化、NLP、阅读理解和生成四大类,结果显示 GPT-4o 表现最佳,而 SEA-LION 等区域模型在参数效率上具有优势。开源模型在成本效益上优于商业模型,但翻译任务仍是主要难点。
Hugging Face 发布 TextQuests 基准测试,基于 25 款经典 Infocom 互动小说游戏评估大语言模型作为自主智能体的长上下文推理能力。测试显示,随着上下文窗口超过 100K tokens,模型易出现幻觉及动作重复,且在 Wishbringer 和 Zork I 等需要空间推理的任务中表现不佳。
OpenAI 致信加州州长加文·纽森,呼吁加州在 AI 监管方面发挥引领作用。信中主张将州级 AI 监管标准与国家及全球新兴标准相协调,以确立统一的监管框架。
Hugging Face 在 Accelerate 和 Axolotl 中集成 ND-Parallel,提供 FSDP、TP、CP 及其组合的配置方法,帮助优化多节点大模型训练的显存与通信效率。
推荐理由:原文给出了多GPU并行策略的组合配置方法,读者可以据此优化大规模模型训练的显存与通信效率。
Hugging Face 发布开源工具 AI Sheets,提供类电子表格的无代码界面,支持在 Hub 或本地部署,利用数千个开源模型构建、转换和增强数据集。用户可通过编写提示词生成新列,并通过手动编辑和点赞单元格作为 few-shot 示例来迭代优化模型输出,最终可将结果导出至 Hub 并生成配置文件。
推荐理由:提供无代码表格界面与本地部署选项,支持通过手动反馈迭代优化提示词,便于快速构建和增强数据集。
OpenAI 发布 GPT-5,将其定位为最先进的模型,旨在通过变革企业 AI、自动化及劳动力生产力,开启智能工作新时代。
OpenAI 在 API 平台正式推出 GPT-5,提供针对开发者的新控制选项,并在真实编码任务中实现最佳结果。
推荐理由:官方宣布 GPT-5 API 上线,强调推理性能与编码任务表现,开发者可据此评估升级价值。
GPT-5 解锁了编码与设计领域的新可能性。该模型旨在通过提升智能水平,帮助用户更高效地完成代码编写与视觉设计任务,拓展了人工智能在创意与开发工作流中的应用边界。
GPT-5 提供创意写作辅助功能。该指南详细演示了如何利用 GPT-5 进行创意写作,帮助用户掌握相关技巧。
GPT-5 被用于医学研究。该文档展示了如何利用 GPT-5 开展相关研究工作。
Cursor 使用 GPT-5 构建其核心功能。
OpenAI 发布 GPT-5 System Card,解释了其统一模型路由系统如何调度 gpt-5-main、gpt-5-thinking 及 gpt-5-thinking-nano 等模型,以针对不同任务和开发者需求提供快速且智能的响应。
Amgen 展示了其使用 GPT-5 的具体实践。
OpenAI 发布文章介绍 GPT-5 中的安全生成(safe-completions)方法,旨在通过以输出为中心的安全训练,在应对双重用途提示词时实现安全性与有用性的平衡。
OpenAI 发布 GPT-5,宣称其在编码、数学、写作、健康、视觉感知等领域具备最新性能,是此前模型在智能上的重大飞跃。
推荐理由:GPT-5 在编码、数学和视觉感知等核心能力上宣称达到最新水平,为评估其实际智能跃升提供了基准。
一组顶尖开发者首次使用 GPT-5 的开发者展示了其实际应用能力。
Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。
推荐理由:TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。
OpenAI for Government 宣布与美国总务管理局(GSA)合作,未来一年向美国联邦行政部门 workforce 免费提供 ChatGPT Enterprise。
推荐理由:OpenAI 宣布向美国联邦政府免费开放 ChatGPT Enterprise,展示了其在公共部门的商业化落地进展。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可证。模型在推理任务上表现优异,具备强大的工具使用能力,并针对消费级硬件进行了高效部署优化。
推荐理由:OpenAI 发布两款开源模型,兼顾推理性能与消费级硬件部署成本,为开发者提供新选择。
OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。
推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重的推理模型,采用 Apache 2.0 许可及官方使用政策。
推荐理由:OpenAI 发布两款开源推理模型并提供 Apache 2.0 许可,为开发者提供了直接复用的前沿推理能力。
OpenAI发布其最强大的开源权重模型,旨在让先进AI更开放、灵活且易于全球访问。此举标志着公司在将AI普及给尽可能多人群的使命上迈出重要一步,致力于打破技术壁垒,提升AI的可及性。
研究发布 gpt-oss 的最坏前沿风险,引入恶意微调(MFT)方法,试图通过微调使其在生物学和网络安全领域达到最大能力。
NVIDIA 发布开源 AI-Q 智能体栈,基于 Llama 3.3-70B 和 Llama-3.3-Nemotron-Super-49B-v1.5 模型,在 Hugging Face DeepResearch Bench 的 LLM with Search 类别中以 40.52 分登顶。该方案支持本地部署与隐私合规,提供完整的推理追踪与评估指标。
推荐理由:NVIDIA 开源 AI-Q 智能体栈并在 DeepResearch Bench 登顶,展示了 Llama Nemotron 在复杂推理任务中的能力。
OpenAI 正在优化 ChatGPT 以支持用户在不同场景下的发展。该平台已推出提醒休息功能,并致力于改善对艰难时刻的支持及提供更好的人生建议,所有改进均基于专家意见。
Hugging Face 发布 3LM 基准测试,专门评估阿拉伯语大语言模型在 STEM 学科和代码生成领域的表现。该基准包含 865 道原生 STEM 选择题、1,744 道合成高难度题目及基于 HumanEval+ 和 MBPP+ 翻译的代码任务。测试显示 Qwen2.5-72B-Instruct 在 STEM 选择题中表现最佳,GPT-4o 在代码生成任务中得分最高。
Mistral 展示通过 LoRA 微调 Pixtral-12B 在卫星图像分类任务上的显著性能提升。基线模型在区分“游乐场”与“体育场”等细微视觉差异时存在幻觉,微调后模型能更准确地识别密集住宅、稀疏住宅等复杂场景。该过程利用 Mistral 微调 API 或 LaPlateforme UI 即可高效完成,无需 extensive 超参数调整。