Claude 新增文本生成动画视频与实时数据看板功能
Anthropic 为 Claude 推出两项新功能:Motion 可根据文本、图表和图片生成可编辑代码并导出 MP4 的动画解说视频;Dashboards 连接 BigQuery 等数据源,通过文本提示生成带底层查询的自动更新实时看板。
Anthropic 为 Claude 推出两项新功能:Motion 可根据文本、图表和图片生成可编辑代码并导出 MP4 的动画解说视频;Dashboards 连接 BigQuery 等数据源,通过文本提示生成带底层查询的自动更新实时看板。
演员 Ben Affleck 因在采访中深入阐述 AI 技术细节而走红网络。他详细解释了卷积神经网络、Transformer 架构及 GPU 推理等概念,并透露曾访问 OpenAI。Affleck 还分享了其 AI 电影创业经历,包括以约 $587 million 出售公司,以及在电影《Animals》中通过解冻权重微调开源视频模型的具体实践。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT‑Image‑2.5 帮助创作者将创意转化为详细的图像和电影级视频广告。
开发者 Brandon Thomas 使用 Anthropic 的 Claude Opus 5.5 在 Rust 中逆向工程 Adobe 软件,推出 Artcraft 套件。该套件包含 Photoshop、Illustrator 等七款开源应用,旨在复刻 Adobe 产品的界面与功能。目前处于早期 Alpha 阶段,提供 Rust 及 WebAssembly 版本。
Google 推出全新的 SynthID.com 网站,允许用户直接检测 AI 生成内容中的隐形水印,无需通过 Gemini 模型。该检测器现已支持 Google 合作伙伴的水印,解决了此前仅能检测 Google 自家 SynthID 的局限。
Google Research 发布 AI 视频联合导演框架,通过 Co-Director、CANVAS、A²RD 和 VQQA 四个模块解决长视频生成的语义漂移和一致性难题,并推出 GenAD-Bench、HardContinuityBench、LVBench-C 等评测基准。
推荐理由:提出多智能体框架解决长视频生成的语义漂移与一致性难题,并发布了四个专用评测基准。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。
推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能。该功能通过动态搜索和扫描视频片段,将长视频分析的 token 消耗降低高达 88%,成本降低 66%,准确率提升 7%。
推荐理由:Gemini 3.7 Flash 等模型新增智能体视频理解功能,通过动态检索显著降低视频分析成本并提升准确率。
Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展、首尾帧控制、360p快速草稿及4K超分等能力,支持通过 Gemini API 在 Google AI Studio 和 Agent Platform 构建专业视频工作流。
推荐理由:新增场景延展、首尾帧控制与4K超分等精细控制能力,为专业视频工作流提供了更可控的生成方案。
Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。
推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。
Google 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。Nano Banana 2 Lite 主打极速低成本图像生成,4 秒出图,价格 0.034 美元/千张,可无缝替代旧版 Nano Banana。
推荐理由:Nano Banana 2 Lite 提供极速低成本的图像生成,Gemini Omni Flash 开放视频生成与对话编辑,两者结合可构建端到端的多媒体工作流。
Hugging Face 推出 agents.md 标准,使 Agent 能直接调用 Gradio Space 的 API 进行链式组合。作者通过该机制调用 ideogram-ai/ideogram4 生成图像,再经 VAST-AI/TripoSplat 重建 3D 高斯泼溅,最终自动构建并部署了 3D 巴黎地标画廊,展示了多媒体应用开发的模块化新范式。
推荐理由:通过 agents.md 实现 Hugging Face Spaces 的标准化调用与链式组合,展示了 Agent 构建多媒体应用的低成本路径。
Google DeepMind 在 Project Genie 中新增 Street View 功能,允许用户基于美国真实地点生成可交互的虚拟世界。该功能结合 Maps Imagery Grounding 技术,支持“Ocean World”等风格,用户可自定义角色探索或重塑现实场景。Project Genie 现已面向全球 18 岁以上 Google AI Ultra 订阅用户开放。
Google 发布 Gemini Omni Flash,支持将图像、音频、视频和文本作为输入生成高质量视频,并可通过自然语言对话进行编辑。该模型已面向 Google AI Plus、Pro 和 Ultra 订阅用户以及 YouTube Shorts 用户开放。
推荐理由:原文给出了多模态输入生成视频的能力细节和开放入口,读者可以据此判断它对现有视频创作工作流的影响。
Google 将 SynthID 和 C2PA Content Credentials 内容验证工具扩展至 Search、Gemini 和 Chrome,帮助用户识别内容的生成来源与修改历史。
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。