VC-Attention针对视频扩散变换器的值量化误差与softmax性能瓶颈,提供免训练低比特注意力内核实现加速。
视频 DiT 将一段视频展平成一条时空 token 序列,并在每一层运行完整的自注意力机制。一段 5 秒 720p 的 Wan2.2-14B 视频包含约 70K 个 token。在 RTX 5090 上,attention 消耗了超过 64% 的生成时间。研究团队指出,在单块 B200 上,每次 MiniMax-H3 去噪步骤中,attention 大约占据三分之二的时间。
低比特 Tensor Core 可以加速 QK 和 PV 两次矩阵乘法,但仍有两大障碍。首先,此前的方法(如 SageAttention2)会对 query 和 key 进行平滑处理。经过 QK 平滑和旋转后,value 项在 Wan2.2 上占据了 82% 的输出误差。其次,两次矩阵乘之间的 softmax 仍以 FP32 运行。在 B200 和 H200 上,指数运算及其 FP8 转换成为了最耗时的流水线阶段。
Value 离群值集中在少量 token 中,且其通道在 heads、层和步骤之间会发生变化。Hadamard 旋转能保持 token 范数,因此无法消除它们。旋转 V 只会在 value 误差上增加 0.2%。
V-Smooth 走了另一条路:
在 100 个 Wan2.2 head 上取平均后,块均值在序列顺序上去除了 8% 的块能量。在 DeltaQuant 静态立方体下去除了 12%,排序后去除了 36%。每个均值对每个 value 元素花费 0.125 比特。
分组操作只在去噪步骤的前 25% 中运行。置换在相邻的 4 个步骤中复用。在完整调度上取平均,分组操作占 attention 时间的 3% 到 4%。
一个 E4M3 字节已经接近它所存储值的对数。以整数方式读取时,它大约等于 8 log₂(v) + 56。因此 ExpCast-FP8 直接从对数域分数写出字节,只需 1 次融合乘加。常数 β = -0.35 将剩余误差居中,不需要为每个模型拟合常数。
在每次倍增的 79.6% 上,直接路径写出的字节与 FP32 先指数后转换路径完全一致。其余情况也只差 1 个码。论文证明了每行总变差小于 3.64% 的界限,加上任何下溢尾分布。在 204.8K 行 Wan2.2 attention 上,实测平均值为 1.6%。ExpCast-FP8 只适用于 8 比特内核,因为 NVFP4 没有单一的仿射对数到码的映射。
手写的 CuTe/CUDA 预处理链 fusion 将一次 V-Smooth 调用在 B200 上从 42.2ms 削减到 4.8ms。
测试覆盖了 4 个开源视频 DiT:Wan2.2-T2V-A14B、LongCat-Video、HunyuanVideo-1.5 和 MiniMax-H3。保真度以 BF16 FlashAttention-4 输出为基准,在 100 条提示词上打分。
| GPU | 精度 | Attention 加速比 | 端到端加速比 |
|---|---|---|---|
| B200 | 8-bit | 1.59× | 1.19× |
| H200 | 8-bit | 1.46× | 1.13× |
| RTX PRO 6000 | 4-bit | 2.27× | 1.36× |
| RTX 5090 | 4-bit | 3.58× | 1.70× |
在 B200 上,VC-Attention 比 SageAttention2 快 6.02 倍,而 SageAttention2 没有提供 Blackwell 内核。在 H200 上,差距为 1.16 倍。在工作站显卡上,4 比特 V-Smooth 在 RTX PRO 6000 上与 SageAttention3 持平。在 RTX 5090 上保持在 5% 以内,保真度差异将两者区分开来。
在 8 比特下,V-Smooth 在 Wan2.2 上比 SageAttention2 高出 2.3 dB PSNR,在 HunyuanVideo-1.5 上高出 2.8 dB。
加上 ExpCast-FP8 可以恢复 0.7 到 2.1 dB,但在所有 4 个模型上仍然胜过 SageAttention2。
在 4 比特下,V-Smooth 在 Wan2.2 上比 SageAttention3 高出 2.9 dB,在 LongCat-Video 上高出 3.6 dB。
以训练-free 方式运行时,Attn-QAT 比 SageAttention2 低 3.4 到 6.7 dB。
在 MiniMax-H3(1344×768)上,attention 在 B200 上比 BF16 FlashAttention-4 快 1.60 倍。PSNR 为 20.2 dB,而 SageAttention2 为 19.9 dB。在 B300 上,论文报告为 1.47 倍相比朴素 FP8 内核的 1.31 倍。博客图表列出 B300 为 1.51 倍。
Nunchux Attention(Nunchux 的专有扩展)在 B200 上对 MiniMax-H3 attention 达到 1.91 倍,在 B300 上达到 1.83 倍。
该方法只改变每次交互的成本。因此可以与 Sparse VideoGen 和 Radial Attention 等稀疏注意力机制、以及蒸馏和多 GPU 执行组合使用。Nunchux 表示将过 Modelverse 等待名单提供免费的 MiniMax-H3 访问。
VC-Attention 是 Nunchux AI 为视频 DiT 打造的训练-free 低比特 attention 内核。
V-Smooth 对 value token 聚类,然后在块均值减去后只量化残差。
ExpCast-FP8 用 1 次乘加替换了 FP32 指数和转换操作。
Wan2.2 attention 在 B200 上快 1.59 倍,在 RTX 5090 上快 3.58 倍。
目前尚无公开内核发布;Nunchux 在其栈中运行专有扩展。