先看证据

400个广告场景Co-Director评测集
数据覆盖200个虚构产品、50个品牌关键事实
CANVAS背景连续性提升21.6%关键事实
CANVAS角色一致性提升9.6%关键事实
A²RD展示了10分钟影片关键事实
LVBench-C包含120个场景关键事实

把机制串起来

输入先把素材压到可处理的规模

视频扩散模型擅长把单个提示词变成高画质短片,但并不天然维护跨镜头的角色、道具、空间和因果关系。长视频本质上不是把短片首尾相接,而是要持续保存世界状态,并判断哪些内容该延续、哪些内容该变化。所谓信用分配,就是在最终视频出问题时,定位到底是哪个早期决策或生成环节造成了后续崩坏。

机制再把计算集中到关键步骤

Co-Director用多臂老虎机在创意策略、叙事模式和美学原型之间探索:全局搜索负责试不同创作方向,局部多模态自反思负责修正具体镜头。预制代理先生成故事板,关键帧、视频和音频代理再执行,MLLM评审器把整段成片拆成因素评分,并将奖励回传给老虎机。这样设计的代价是生成与评估次数增加,但能把最终质量反馈用于选择策略,而不是依赖一次性的手工提示词。CANVAS则把角色、地点和物体状态存成可检索的视觉锚点,场景重返时取回锚点,避免模型重新“猜”同一对象。A²RD按段执行检索、合成、

结果最后落到可验证的工作结果

['适合广告、短片和多镜头叙事等需保持身份一致的任务', '长片生成应保存角色、地点、道具的可检索状态', '新情节用外推,旧角色或场景回归用插值', '不适合只追求单镜头画质、无需跨镜头一致性的任务']

短片段能生成,长故事却会散架

扩散模型能在几秒内渲染出高保真片段,这是过去两年视频生成最显眼的进展。但把若干这样的片段缝成一个有连贯叙事的故事,失败率依然很高:人物的外套颜色在中段变了,场景里的道具在某个镜头后消失,或者在后续镜头里换了形态。Google Research 把这套问题定义成两个具体故障模式——语义漂移与级联失败。前者指衣着、场景在镜头之间慢慢偏移,后者指上游一个坏资产污染所有下游镜头。

更棘手的是归因。Google 团队把它称为 credit assignment problem:一段最终失败的视频,很难追溯到究竟是哪一个 prompt 造成的。大多数 agentic 视频管线把模块串起来,每个模块配一份独立、手工编写的 prompt,模块之间的耦合是隐式的,所以错误一旦发生,修正也无从下手。这解释了为什么很多流水线在单镜头 demo 好看,一到多镜头分钟级视频就崩。

四个框架覆盖规划、记忆、长程生成与自我纠错

Google 的方案不是重训模型,而是构建一层模型无关的编排层,叠在 Gemini 和 Veo 之上,输出继承基座模型的 SynthID 水印。第一个框架 Co-Director 已被 COLM 2026 接收,把创作规划建模为多臂老虎机问题。Orchestrator Agent 在 Creative Strategy、Narrative Mode、Aesthetic Archetype 三个维度上选一组配置,Pre-Production Agent 据此生成分镜,Keyframe、Video、Audio 三个子 Agent 产出媒体,最后由 MLLM Judge 打分,把 factored reward 回传给老虎机。

第二个框架 CANVAS 被 EMNLP 2026 接收,负责持久视觉记忆:它追踪角色、地点和物体状态随剧情演变,当某个场景回归时召回存储的视觉锚点。在 Google 的博物馆盗窃测试里,AutoStudio 丢掉了小偷的帽子,Gemini-3.1-Pro 换掉了宝石,CANVAS 两样都保住了。第三个框架 A²RD(Agentic Autoregressive Diffusion)是无训练架构,每个片段跑一轮 Retrieve、Synthesize、Refine、Update 循环,对着一份多模态视频记忆工作,并在新剧情节拍用外推、回归实体用内插之间切换。

VQQA 把提示词改写当成语义梯度

第四个框架 VQQA 处理自我纠错。它为每条 prompt 生成视觉问题,用 VLM 的批评作为“语义梯度”来重写文本 prompt,而且不需要访问模型内部——这是它相对权重级微调最实际的差异。一个 Global Selection 步骤在所有迭代里挑选最佳视频,而不是默认采用最后一次输出。

这四层的分工值得注意:Co-Director 管规划,CANVAS 管状态记忆,A²RD 管长程生成,VQQA 管闭环纠错。它们不是一条串联流水线,而是覆盖四类不同性质的问题。多数现有系统只做了其中一层——通常是规划和生成,然后把一致性问题留给模型本身。Google 的判断是,一致性问题本质上是世界状态追踪问题,模型本身不负责这件事,编排层才负责。

三个新基准和一组必须读清楚的数字

Google 同时发布了三个基准。GenAD-Bench 覆盖 50 个品牌、200 个虚构产品、400 个广告场景;HardContinuityBench 的压力点是场景重现和道具状态变化;LVBench-C 的 120 个场景里,关键资产至少消失 10 个片段后才回归,专门用来测召回。

结果方面:Co-Director 在 GenAD-Bench 上平均 81.4 分,人类评分 3.96/5,对照的基线包括 Veo 3.1、Kling 3.0 Omni、Wan 2.6 和 MovieAgent,其随机搜索基线为 75.7。CANVAS 在背景连续性上提升 21.6%、角色一致性提升 9.6%、道具一致性提升 7.6%。A²RD 在 1 到 10 分钟视频上一致性提升最多 30%,叙事连贯性提升 20%。VQQA 在 T2V-CompBench 上绝对提升 11.57%,VBench2 上提升 8.43%。Google 还放出了一部用 A²RD 生成的连续 10 分钟影片。

这些数字能说明什么,不能说明什么

有三个细节需要比分数本身更谨慎地对待。第一,基准是 Google 自己构建的,GenAD-Bench、HardContinuityBench、LVBench-C 都由提出方设计,任务分布、评分口径和难度分布都掌握在作者手里;跨论文的系统比较在缺少第三方基准的情况下说服力有限。第二,CANVAS 的博物馆测试是一个定性案例,展示的是两个具体资产在特定剧情里的保持,不能外推成普遍的角色一致性保证。

第三,A²RD 的 30% 一致性提升和 20% 叙事连贯性提升是最多值而非平均值,而 10 分钟影片是一个精选 demo。长视频生成的评估本身就很难自动化,人类评分和自动指标经常不一致,Google 同时给出两者算是诚实,但两者的结论并不总是对齐。

对技术负责人意味着什么

可用性上,Co-Director 和 A²RD 的代码已经在 GitHub 上,CANVAS 代码待发布,完整管线尚未全部开放。这意味着现在能复现的是规划层的 bandit 搜索和长程生成的无训练循环,视觉记忆层和 VQQA 的闭环纠错还只能按论文描述自行实现。

架构上更重要的启示是分层边界。如果你在做多镜头视频管线,一致性故障往往不是生成质量问题,而是状态管理问题。把一致性当成模型能力去调 prompt,收益会很快见顶;把角色、地点、道具状态从提示词里显式剥离成一个可检索的记忆层,才有继续改的空间。VQQA 的语义梯度思路也给出了一个低成本选项:在不能访问模型内部的前提下,用 VLM 批评改写 prompt 并在所有迭代里做全局选择,比默认采用最后一次输出更稳。

边界:世界状态追踪仍未解决

这套方案把长视频生成重新定义成全局优化和世界状态追踪问题,这个框架比四个具体框架更有生命力。但边界同样清楚:CANVAS 依赖视觉锚点的检索召回,LVBench-C 里关键资产消失 10 个片段后才回归,正是这种召回压力最大的场景;A²RD 保持无训练,意味着它的上限受基座模型约束;VQQA 的语义梯度只在文本空间操作,改不动画面本身的物理不一致。

一个可以执行的判断是:如果你的视频时长在 1 到 10 分钟、场景数在几十个量级,这套分层值得照搬思路;如果资产数量或剧情跨度继续放大,记忆检索的召回质量会先成为瓶颈,而不是生成质量。Google 目前没有给出记忆层在更长跨度下的衰减数据,这是后续最该被第三方复现验证的部分。