OpenAI 推出 OpenAI for Government
OpenAI 推出 OpenAI for Government 计划,旨在将最先进的 AI 工具引入美国公共服务领域。该举措支持美国政府采用顶级技术,以造福公众。
OpenAI 推出 OpenAI for Government 计划,旨在将最先进的 AI 工具引入美国公共服务领域。该举措支持美国政府采用顶级技术,以造福公众。
TNG实测发现长提示词会阻塞预填充队列并拖慢并发解码,vLLM通过限制长提示并行数优化首字延迟,而预解码分离架构可彻底消除干扰。
推荐理由:通过实测对比揭示了长提示词对并发推理的干扰,并给出了vLLM并行预填充与预解码分离的具体优化方案。
Hugging Face Hub 宣布支持 Featherless AI 作为新的 Inference Provider,提供涵盖 DeepSeek、Meta、Google、Qwen 等厂商开源模型的无服务器推理服务。用户可通过 Python 或 JS 客户端 SDK 调用,支持自定义 API Key 直连或经 HF 路由计费。PRO 用户每月可获得 2 美元推理额度。
OpenAI 与 Mattel 达成合作,将 AI 技术整合至芭比(Barbie)和风火轮(Hot Wheels)等标志性品牌中。此举旨在优化创意开发流程、提升工作效率,并为粉丝创造全新的互动体验方式。
NVIDIA发布Isaac GR00T N1.5微调教程,演示如何利用EmbodimentTag系统适配LeRobot SO-101机械臂。教程涵盖从环境安装、数据集配置到模型微调、开环评估及物理部署的完整步骤。
推荐理由:提供基于LeRobot SO-101机械臂的GR00T N1.5微调全流程,含环境配置、数据集准备及部署代码。
Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 及服务的私有集成 AI 基础设施栈。作为 NVIDIA 合作伙伴,该服务提供数万张 GPU 资源,支持从裸金属服务器到全托管 PaaS 的多种形态。此举旨在满足欧洲等地区对数据主权和可持续性的要求,为各国政府、企业及研究机构提供独立可控的 AI 算力环境。
Hugging Face 与 NVIDIA 联合推出 Training Cluster as a Service,旨在降低全球研究机构获取大型 GPU 集群的门槛。
Mistral AI 发布首款推理模型 Magistral,包含 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。该模型支持多语言透明推理,Medium 版在 AIME2024 上得分 73.6%,Small 版得分 70.7%。开源版采用 Apache 2.0 协议,企业版可通过 Le Chat、API 及各大云平台获取。
推荐理由:Mistral 发布首款推理模型 Magistral,提供开源与商业双版本,支持多语言透明推理。
OpenAI 推出主动协调披露政策(Outbound Coordinated Disclosure Policy),旨在指导其如何负责任地向第三方软件报告漏洞。该政策强调在规模化运营中保持诚信、协作与主动安全。此举明确了 OpenAI 在发现第三方软件安全问题时的对外沟通与披露规范。
Hugging Face 发布 ScreenSuite,这是目前最全面的 GUI 智能体评估套件,包含 13 个涵盖感知、定位、单步和多步操作的基准。该套件采用纯视觉输入(不含 DOM 或无障碍树),提供 Docker 容器化环境以支持 Ubuntu 和 Android 的本地部署,并基于 Qwen-2.5-VL、UI-Tars-1.5 等模型进行了基准测试。
推荐理由:ScreenSuite 统一了 13 项 GUI 智能体评测基准,提供纯视觉评估方案与 Docker 部署工具,便于开发者对比测试模型能力。
OpenAI 正在对抗《纽约时报》及原告提出的无限期保留 ChatGPT 和 API 用户数据的法院命令。公司致力于在满足法律要求的同时,坚持履行数据保护承诺并维护用户隐私。
OpenAI 发布最新报告,通过案例研究展示其检测与防止 AI 恶意使用的方法。该报告详细记录了公司在应对恶意 AI 应用方面的具体实践与成果。
Mistral 发布 Mistral Code,整合 Codestral、Devstral 等四种模型,提供 IDE 插件、私有化部署及企业级管控,目前面向 JetBrains 和 VSCode 开放私有测试。
推荐理由:整合了四种专用模型与企业级管控,提供私有化部署选项,适合对安全合规有严格要求的开发者。
nanoVLM 从零实现了 KV Cache 技术,使自回归生成速度提升 38%。该技术通过缓存已计算的 Key 和 Value 矩阵,消除了自回归生成过程中的计算冗余,将生成过程从全序列重计算转变为轻量级增量更新。
H Company 在 Hugging Face 开源了 Holo1 系列动作视觉语言模型(含 3B 和 7B 版本)及 WebClick 多模态定位基准。基于该模型的 Surfer-H 网页智能体通过纯浏览器交互实现自动化,在 WebVoyager 基准上达到 92.2% 准确率,单次任务成本仅 0.13 美元。
推荐理由:开源了专为GUI定位优化的VLM及WebClick基准,提供了低成本高准确率的网页自动化方案。
Hugging Face 发布 SmolVLA,一款450M参数的开源视觉语言动作模型,可在消费级硬件上运行。该模型基于 LeRobot 社区数据预训练,支持异步推理,响应速度提升30%,任务吞吐量翻倍,在仿真和真实世界任务中表现优异。
推荐理由:开源450M视觉语言动作模型,利用异步推理实现30%提速,可在消费级硬件上运行。
TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。
推荐理由:TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。
OpenAI 封禁了与公开归因于中国的威胁行为者相关的账户。这些账户利用 AI 支持漏洞研究、脚本编写、翻译及运营故障排除。
OpenAI 封禁了利用 AI 进行社会工程、监控主题研究及针对批评者的影响活动的账号。此举旨在遏制滥用 AI 技术进行恶意操纵的行为,维护平台安全与合规性。
OpenAI 封禁了疑似源自俄罗斯并利用 AI 生成关于乌克兰、北约及国内议题的德语政治内容的账户。
OpenAI 封禁了疑似源自柬埔寨并利用 AI 支持针对英国用户诈骗流程的账户。该行动旨在打击名为“Operation Wrong Number”的 AI 辅助任务诈骗行为。
OpenAI 封禁了利用 AI 生成帖文批评台湾社交媒体网红及相关美国话题的账号。此举旨在遏制源自中国的影响力活动,维护平台内容生态。
OpenAI 封禁了使用 AI 构建恶意软件、优化加载器及调试网络工具的俄语账户。此举旨在遏制利用人工智能技术进行网络攻击和恶意代码开发的行为。
OpenAI 封禁了跨社交平台利用 AI 生成关于菲律宾政治及公职人员评论的账号。此举旨在遏制通过人工智能技术干预他国政治议题的行为,维护平台内容的合规性与真实性。
OpenAI 封禁了与涉嫌欺诈性远程求职活动相关的账户。这些账户被指控利用 AI 开发虚假材料,以进行欺骗性的就业申请。此举旨在打击利用人工智能技术进行的招聘欺诈行为。
OpenAI 封禁了与 STORM-2035 行动相关的账户,该行动利用 AI 生成涉及美国、英国、爱尔兰和委内瑞拉政治的影响力内容。OpenAI 认定该行动很可能与伊朗有关。
OpenAI 封禁了利用 AI 生成美国政治内容并研究相关人群、运动及在线社区的中国起源账号。此举旨在遏制针对美国政治极化的影响力活动,维护平台内容生态的安全与合规。
OpenAI 为 Wix 的 AI Website Builder 提供技术支持,用户只需通过对话描述想法,即可在几分钟内创建完整的网站。该工具降低了建站门槛,让非技术人员也能快速实现网站构建需求。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,支持不同维度和精度输出以平衡检索质量与存储成本。该模型在 SWE-Bench 等基准上表现优于 Voyage Code 3、Cohere Embed v4.0 及 OpenAI 大嵌入模型,API 定价为每百万 token 0.15 美元。
推荐理由:官方发布首个代码专用嵌入模型,提供多维精度选择并宣称在多项基准上超越竞品。
Hugging Face 发布研究,证实强制 CodeAgent 以结构化 JSON 格式生成思维与代码,可消除 Markdown 解析错误并提升基准测试表现。该方法在 32B 以上大模型上效果显著,但小模型面临“结构化税”导致性能下降。
推荐理由:研究证实结构化输出能消除代码解析错误并提升智能体性能,同时揭示了小模型应用该方法的局限性。
Mistral 发布 Agents API,提供内置代码执行、图像生成、文档库和网页搜索连接器,以及持久记忆功能。该 API 支持多智能体动态编排与任务交接,并兼容 MCP 协议。在 SimpleQA 基准测试中,开启网页搜索后 Mistral Large 和 Medium 的准确率分别提升至 75% 和 82.32%。
推荐理由:Mistral 推出官方智能体 API,内置代码执行、搜索等连接器及持久记忆,支持多智能体编排与 MCP 协议。
用户在使用 Liger GRPO 结合 DeepSpeed ZeRO3 对 Qwen/Qwen2.5-0.5B-Instruct 进行 bf16 训练时,遭遇 shape mismatch 报错。错误堆栈显示问题出在 liger_kernel 的 fused_linear_ppo 模块中,涉及 torch._dynamo 编译过程中的代码转换环节。
OpenAI 宣布将基于 GPT-4o 的 Operator 模型替换为基于 o3 的版本,API 版本仍基于 4o。
推荐理由:原文明确了底层模型从GPT-4o切换至o3,读者可据此评估Operator智能体能力的升级幅度。
Hugging Face 联合 Dell Enterprise Hub 提供预优化模型与应用的本地部署方案。平台支持 Meta Llama 4 Maverick、DeepSeek R1 等模型在 NVIDIA H200、AMD MI300X 及 Intel Gaudi 3 硬件上运行,并集成 OpenWebUI 等应用。
Hugging Face Blog宣布huggingface_hub新增MCP客户端支持,允许LLM通过MCP协议连接外部工具。官方提供CLI工具tiny-agents和极简Python代码示例,展示如何构建连接MCP服务器的智能体。
推荐理由:huggingface_hub新增MCP客户端支持,提供CLI和极简Python代码示例,降低构建智能体门槛。
OpenAI 推出 o3、o4-mini 和 GPT-4.1 以加速代码交付。CodeRabbit 利用这些模型优化代码审查流程,提升准确率并加快 PR 合并速度,帮助开发者以更少的缺陷和更高的投资回报率实现快速发布。
OpenAI 推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
Mistral 发布 Devstral 智能体编码模型,在 SWE-Bench Verified 基准上取得 46.8% 成绩,超越 Deepseek-V3 和 Qwen3 等更大模型。该模型支持本地部署与 API 调用,提供 Apache 2.0 开源许可。
推荐理由:Mistral 发布 Devstral 智能体模型,在 SWE-Bench Verified 基准上超越开源与闭源竞品,并提供本地部署与 API 接入。
TII 发布 Falcon-H1 系列开源模型,包含 0.5B 至 34B 六种规模及指令微调版本,采用 Attention 与 SSM 混合架构。该系列原生支持 18 种语言,上下文窗口达 256K,在长序列生成时吞吐量最高提升 8 倍,且小参数模型性能媲美更大规模的 Transformer 模型。
推荐理由:混合架构在长上下文下吞吐量提升显著,为资源受限场景提供了兼顾性能与效率的开源替代方案。
TII 发布 Falcon-Arabic,这是一个基于 Falcon 3 架构的 7B 参数多语言模型,通过扩展词表至 32,000 个阿拉伯语 token 并采用新颖的嵌入初始化策略进行适配。该模型在 OALL v2 基准测试中表现优异,超越同规模及其他规模达 4 倍的阿拉伯语 LLM,支持现代标准阿拉伯语及多种方言,并提供 Base 和 Instruct 两个版本的开源权重及在线演示。
推荐理由:Falcon-Arabic 基于 Falcon 3 架构适配阿拉伯语,在 OALL 基准测试中超越同规模及更大模型,提供开源权重与演示入口。