vLLM 并发请求优化:Prefill 与 Decode 的调度策略
文章分析了 LLM 推理中 Prefill 和 Decode 阶段的资源差异,对比了静态批处理、Prefill-First 和 Chunked Prefill 三种并发调度策略,指出 Chunked Prefill 能显著提升吞吐量。
推荐理由:文章对比了静态批处理、Prefill-First和Chunked Prefill三种并发策略,给出了vLLM中提升吞吐量的具体实践建议。
文章分析了 LLM 推理中 Prefill 和 Decode 阶段的资源差异,对比了静态批处理、Prefill-First 和 Chunked Prefill 三种并发调度策略,指出 Chunked Prefill 能显著提升吞吐量。
推荐理由:文章对比了静态批处理、Prefill-First和Chunked Prefill三种并发策略,给出了vLLM中提升吞吐量的具体实践建议。
OpenAI发布o3和o4-mini系统卡片,指出两者结合了最先进的推理能力与完整的工具功能,包括网页浏览、Python执行、图像与文件分析、图像生成、Canvas、自动化、文件搜索和记忆。
推荐理由:官方明确了o3和o4-mini的推理能力与工具调用范围,为评估其实际工作流价值提供了基准。
OpenAI 发布 o3 和 o4-mini 模型,将其定位为迄今最智能、最强大的模型,并支持完整的工具访问功能。
推荐理由:OpenAI 发布 o3 和 o4-mini 模型,提供工具访问能力,标志着其推理模型体系的进一步扩展。
HELMET 发布,旨在全面评估长上下文语言模型(LCLM)。该基准测试评估了 59 款模型,发现前沿 LCLM 在复杂任务上仍受限。文章提供了使用 HuggingFace 库、TGI、vLLM 及 API 运行基准的快速入门指南。
Cohere 成为 Hugging Face Inference Providers 首个模型创作者,支持 serverless 推理。Command A 提供 256k 上下文与 23 种语言支持,Aya Expanse 32B 覆盖 23 种语言,Command R7B 提供 128k 上下文,Aya Vision 32B 支持多模态。
Gradio 是构建机器学习应用的框架,提供 UI 与 API 双重访问能力。Gradio 5.0 引入服务端渲染(SSR)显著降低加载时间,并内置自动队列管理以支持高并发 GPU 任务。其 API Recorder 工具可实时捕获交互生成代码,配合流式传输实现低延迟实时输出。
OpenAI 发布了更新后的前沿 AI 能力严重危害防范框架,旨在更有效地衡量和防范相关风险。该框架体现了公司对前沿模型安全性的持续重视与机制优化。
OpenAI 在 API 中发布 GPT-4.1 新模型家族,在编码、指令遵循和长上下文理解方面实现全面改进,并首次发布 nano 模型,面向全球开发者开放。
推荐理由:GPT-4.1 系列在编码、指令遵循和长上下文理解上全面增强,并首次推出 nano 模型,开发者可立即通过 API 接入。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五笔收购。此次整合旨在将 LeRobot 软件平台与 Reachy 2 等开源硬件结合,推动 AI 与物理世界的交互。Reachy 2 已面向研究机构和开发者开放订购,定价为 7 万美元。
推荐理由:Hugging Face 收购 Pollen Robotics 补齐了具身智能硬件能力,标志着其开源生态从软件向实体机器人领域的实质性延伸。
Protect AI 与 Hugging Face 合作推出 Guardian 四个新威胁检测模块,新增对 PAIT-ARV-100、PAIT-JOBLIB-101、PAIT-TF-200 和 PAIT-LMAFL-300 的支持。截至 2025 年 4 月 1 日,Guardian 已扫描 447 万个模型版本,发现 35.2 万个不安全或可疑问题。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频理解。该 7B 参数模型集成 SigLIP 编码器,支持视觉问答、OCR 及视频处理。模型基于 Apache License, Version 2.0 开源,适用于研究及非商业用途。
OpenAI 发布了 BrowseComp,这是一个专门用于评估浏览智能体能力的基准测试。该基准旨在衡量模型在复杂网页浏览任务中的表现,为相关研究提供标准化评估手段。
Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。
推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。
Hugging Face 与 Cloudflare 达成合作,使 FastRTC 开发者能使用 Hugging Face Token 直接访问 Cloudflare 的全球 TURN 服务器网络。
Hugging Face 联合 MBZUAI 上线 Arabic-Leaderboards Space,整合 AraGen-03-25 与阿拉伯语指令遵循基准。AraGen-03-25 数据集扩展至 340 对问答,o1-2024-12-17 以 69.49% 的 3C3H 得分位居榜首,gpt-4o-2024-08-06 表现显著提升。
OpenAI 发布欧盟经济蓝图,提出一系列旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长的政策建议。该蓝图强调确保人工智能在欧洲境内开发、部署并服务于欧洲。
Canva 首席产品官兼联合创始人 Cameron Adams 探讨了公司如何利用 AI 技术激发用户创造力。
Hugging Face 上线 Meta 发布的 Llama 4 Maverick (~400B) 与 Scout (~109B) 原生多模态模型,两者均为 MoE 架构且激活参数为 17B。Scout 支持 10M 超长上下文并可单卡量化部署,Maverick 在 MMLU-Pro 等基准上显著超越 Llama 3.1 405B。
推荐理由:文章详细披露了MoE架构、超长上下文及量化部署细节,为开发者提供了关键的技术选型依据。
Gradio 月活跃开发者突破 100 万,成为构建和分享 AI Web 应用的标准 UI。其增长得益于提供低层 API 以平衡定制化与维护成本,以及通过 Spaces 分享链接实现病毒式传播。该框架专注于机器学习应用这一细分领域,并通过快速迭代社区需求保持竞争力。
Hugging Face 宣布将运行三年的 NLP 课程升级为 LLM 课程,新增大语言模型微调及 DeepSeek R1 等推理模型构建章节。经典 NLP 内容将保留并引入 Sentence Transformers 等现代方法,同时联合 LlamaIndex、LangChain 等开源库提供多框架实践。
针对多用户并发请求导致 GPU 资源竞争及“超级用户”阻塞其他用户的问题,TNG Technology Consulting 提出在 LLM-Server 层实现公平调度。通过为每个用户建立独立队列并采用轮询机制,避免请求在 vLLM 后端堆积。同时结合 Prometheus 指标动态调整发送速率,以维持后端队列短小从而降低新用户的延迟。
OpenAI 成立新委员会,旨在结合历史级财务资源与技术能力,打造全球装备最强的非营利组织。该组织计划利用可扩展人类创造力的技术,继续利用 AI 帮助人们解决难题。
OpenAI 发布 PaperBench,这是一个用于评估 AI 智能体复制前沿 AI 研究能力的基准测试。该基准旨在衡量 AI 在复现最新研究成果方面的表现。
OpenAI 发布对英国版权咨询的回应,提出促进创新的政策建议,旨在帮助英国成为欧洲的 AI 中心。
OpenAI 宣布完成 400 亿美元新一轮融资,投后估值达到 3000 亿美元。这笔资金将用于推动 AI 研究前沿、扩展计算基础设施,并为每周 5 亿 ChatGPT 用户提供更强工具。
推荐理由:OpenAI 宣布 400 亿美元融资及 3000 亿美元估值,为后续算力扩张与 AGI 研发提供资金保障。
Hugging Face 将密钥管理迁移至 Infisical,以解决多云环境下的安全与效率问题。通过 Infisical Kubernetes Operator 实现密钥自动同步,并集成 Okta 实现细粒度 RBAC 权限控制。该方案消除了本地 .env 文件的安全隐患,并简化了 CI/CD 流水线中的密钥轮换与审计流程。
Hugging Face 宣布 Text Generation Inference (TGI) 正式原生集成 Intel Gaudi 硬件支持,不再需要维护独立分支。该更新支持 Gaudi1 至 Gaudi3 全系列硬件,提供动态批处理、流式响应及 FP8 量化等生产级特性,并针对 Llama 3.1、Mixtral 等主流模型进行了优化。
OpenAI 提出从基于意图的机器人转向主动式 AI 智能体的演进方向。这一转变强调利用 AI 智能体主动执行任务,而非仅被动响应用户指令。
DeepSeek 发布 DeepSeek-V3-0324 模型,在 AIME 和 LiveCodeBench 等基准上显著提升,并采用 MIT 许可证。Hugging Face 提供了通过 TGI、SGLang 及 Unsloth 量化进行本地部署的方法,并说明了模型权重与代码的安全使用规范。
推荐理由:文章详细对比了 DeepSeek-V3-0324 在多项基准上的提升,并提供了本地部署与安全使用的具体指南。
OpenAI 在通往 AGI 的进程中主动调整策略,将全面的安全措施直接构建于其基础设施和模型之中。
文章详细展示了如何使用Sentence Transformers库训练和微调重排器(Cross Encoder)模型,涵盖数据集加载、难负样本挖掘、损失函数选择及评估器配置。作者通过实战训练出超越13个通用开源重排器的小参数模型,并提供了完整代码与评估基准。
推荐理由:文章提供了基于Sentence Transformers训练交叉编码器重排器的完整代码与评估,可直接复现并迁移至自有数据。
OpenAI 宣布在 GPT-4o 中引入原生图像生成功能,强化了文本渲染和指令遵循能力,并开放了 ChatGPT Images 2.5 入口。
推荐理由:GPT-4o 原生集成图像生成功能并强化文本渲染,为多模态交互提供了更直接的入口。
OpenAI 更新 GPT-4o 系统卡片,确认其具备图像生成功能。该能力显著强于早期的 DALL·E 3 系列,可生成写实风格图像并支持以图片作为输入进行转换。
推荐理由:官方确认4o具备图像生成能力并支持图生图,标志着多模态能力向生成端延伸。
Hebbia 推出深度研究功能,利用 OpenAI 技术实现 90% 财务与法律工作自动化。该方案通过 AI 智能体自动化处理相关任务,旨在提升行业工作效率。
OpenAI 宣布管理层更新。随着公司成长为拥有数亿用户的产品提供商,其核心使命仍聚焦于推动前沿人工智能研究以加速人类进步。
Gradio 发布 gr.Dataframe 组件重大更新,在 6 周内修复了 70 多个问题并新增多项功能。更新包括多单元格选择、行号与列固定、搜索与过滤功能、全屏及复制按钮,以及增强的键盘导航和样式控制。最新版本的 gradio 现已上线,用户可通过 pip install --upgrade gradio 进行升级。
OpenAI 与 MIT 媒体实验室合作开展研究,探讨 ChatGPT 的情感使用与情感幸福感。该研究聚焦于早期分析方法,旨在评估用户在使用 ChatGPT 过程中的情感体验及福祉影响。
Hugging Face 对 Inference Endpoints 的分析仪表盘进行了全面升级。更新后的仪表盘支持指标实时刷新,提供可自定义的时间范围与自动刷新功能,并新增副本生命周期视图以追踪各副本状态。后端重构确保高流量场景下数据加载迅速,帮助用户实时监控延迟、错误率等性能指标。
Booking.com 通过将其数据系统与 OpenAI 的大语言模型集成,实现了旅行服务的个性化。该方案提供了更智能的搜索、更快的支持以及基于意图的旅行体验。
OpenAI 在 API 中推出下一代音频模型,首次允许开发者通过提示词指令文本转语音模型以特定方式说话,例如“像富有同情心的客服代表那样说话”,为语音智能体提供了更高程度的定制化能力。