Google 发布 AI 视频联合导演框架及四个长视频生成评测基准
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。
推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。
Hugging Face 推出 agents.md 标准,使 Agent 能直接调用 Gradio Space 的 API 进行链式组合。作者通过该机制调用 ideogram-ai/ideogram4 生成图像,再经 VAST-AI/TripoSplat 重建 3D 高斯泼溅,最终自动构建并部署了 3D 巴黎地标画廊,展示了多媒体应用开发的模块化新范式。
推荐理由:通过 agents.md 实现 Hugging Face Spaces 的标准化调用与链式组合,展示了 Agent 构建多媒体应用的低成本路径。