技术笔记

DiT 与视频 token:时空复杂度估算

将潜空间图像切成 patch 后,Transformer 处理的是 token 序列。

2026年5月20日阅读约 2 分钟
DiT视频注意力

从图像 token 到视频 token

将潜空间图像切成 patch 后,Transformer 处理的是 token 序列。若潜空间帧大小为 H×W、patch 边长为 p、帧数为 F,则简化 token 数为 F×(H/p)×(W/p)。这里假设 H、W 可整除 p,且时间维没有额外压缩。

全局注意力的分数矩阵大小随 token 数平方增长。将帧数加倍可能使注意力分数元素增加至四倍,但真实耗时还受算子、分块注意力和硬件影响,不能直接据此宣称四倍总成本。

可运行的规模计算

import assert from "node:assert/strict";
function videoTokens(frames, height, width, patch) {
  if (![frames,height,width,patch].every(Number.isSafeInteger) ||
      Math.min(frames,height,width,patch) <= 0 ||
      height % patch || width % patch) throw new Error("invalid shape");
  return frames * (height/patch) * (width/patch);
}
assert.equal(videoTokens(16,64,64,2),16384);
assert.equal(videoTokens(32,64,64,2),32768);

实际系统还缺少哪些信息

时间压缩比例、潜空间通道数、位置编码、条件输入和注意力布局都需要从具体模型实现确认。仅知道“使用 DiT”,无法推导出完整视频系统架构或显存占用。

验证视频连续性时应区分身份稳定、运动方向、物体遮挡和镜头切换。逐帧图像质量指标可能忽略时间闪烁。生成结果看似连贯,也不能据此推断模型学会了可靠的物理模拟。

原始资料

感谢阅读本文

如果你觉得内容有帮助,欢迎点赞支持或分享给同行开发者。

785 次阅读53 人赞过