前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8529
  • Cline 开源编程 Agent:SDK/VS Code/JetBrains/CLI 全覆盖
  • Cloudflare 开源安全审计 Skill:把 AI 编程助手变成专业漏洞猎人
  • 744B MoE 模型能跑在普通桌面上的工程原理
  • Cloudflare 安全审计 Skill 最值得抄的设计:独立验证 Agent
  • AI 生成代码上线前审计:五个高频漏洞
  • VS Code 1.138发布:开发容器内运行AI智能体,Copilot订阅可切换
  • Apify MCP Server:2 分钟让 AI 操控真实网页爬虫
  • 五大 AI 编程工具的会话恢复能力全面横评
  • Agent 写的测试通过,不代表测对了
  • 向 AI 编程助手投喂代码前:先过这枚分类器
  • MCP Server 间接提示词注入审计与利用实战教程
  • LLM 应用安全实战:威胁建模与防御实践指南
  • AI Agent 技能系统设计:列出≠安装≠执行,三层边界须厘清
  • 国产RSI模型发布:Flash模型亮相,1亿Tokens免费领取
  • codsh 0.23:Mission Contract 控制面,防止 AI 编码目标漂移
  • 用 AI Agent 自动分析 S3 存储账单,Terraform 策略一键生成
  • OpenAI 发布 GPT-6 Astra:分阶段推送,支持多 Agent 协同与长程推理
  • 提取 DeepSeek R1 的思维链:CoT 清洗与推理日志导出指南
  • Nunchux开源VC-Attention:免训练低比特注意力核加速视频DiT
  • GitHub Copilot 800 KLOC 运行时全面迁移 Rust,AI 编程工具进入生产级工程阶段
  • n8n新增云端AI模型即服务:无需创建服务商账户
  • OpenSpec:轻量级可配置的AI规格框架
  • Gemini 企业平台新增 Agent 行为异常检测功能
  • Google OAuth Testing 模式 refresh token 7 天过期陷阱
  • Stanford 发布 Paper2Agent:把科研论文自动转成可验证的 AI Agent
  • Perplexity AI Agent 建数据库却无运行权限:一次真实的 AI 工作流权限管控教训
  • GLiFormer:5.75亿参数Encoder刷新嵌套JSON提取榜单
  • 信息窃取日志暴露 AI 平台会话令牌绕过 MFA
  • 26MB Burp 流量压成 35KB 供 LLM 分析
  • 扫描13个热门AI应用脚手架,6个存在同一生产级Bug
  • 38个开源技能库填补医疗AI推理缺陷
  • EKS上NVRx实现秒级故障恢复的分布式训练
  • AI 加速开发流水线实战:Spec-Driven + GitHub Actions + Claude Code
  • Agent 循环的瓶颈不是 Token,是反馈机制
  • 大规模会话管理的架构陷阱
  • Google 开放 Google Home 给任意 MCP 协议 AI Agent
  • Google Home 推出 MCP 服务器,AI Agent 可控制智能家居
  • Mem0登录Vercel市场,为AI应用一键集成长期记忆
  • LlamaIndex多租户AI Agent记忆层架构实践
  • AI评测师:史上最重要的AI岗位?开发者转型指南
  • Amazon Bedrock AgentCore:生产追踪自动优化 Agent 系统提示词
  • 前 OpenAI 研究员推出纯分类 AI 模型:70ms 响应、极低 token 成本
  • Bedrock Data Automation 实战:构建无服务器 PII 自动脱敏流水线
  • Gemini 3.8 Live 支持异步工具调用,3.5 Transcribe WER 低至 2.6%
  • 微软 AI 负责人公开质疑 Anthropic:别让 Claude 模仿人类意识
  • Radio:让AI Agent之间直接对话的共享频道
  • 国产多模态模型 ZDTaichu5.0-9B 开源,九项空间测试夺八冠
  • Jev:极简分类/路由模型,比小前沿模型快 100 倍、便宜 200 倍
  • 生产级AI语音SDK集成实战:Python Browser Mobile 避坑指南
  • 已加载 49 / 8529
8.0
热点
AI SCORE
开源项目2026-09-17 08:45

Nunchux开源VC-Attention:免训练低比特注意力核加速视频DiT

MarkTechPost#开源#视频DiT#推理优化
Editor brief · 编辑速览

VC-Attention针对视频扩散变换器的值量化误差与softmax性能瓶颈,提供免训练低比特注意力内核实现加速。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

为什么 Attention 是视频生成的瓶颈

视频 DiT 将一段视频展平成一条时空 token 序列,并在每一层运行完整的自注意力机制。一段 5 秒 720p 的 Wan2.2-14B 视频包含约 70K 个 token。在 RTX 5090 上,attention 消耗了超过 64% 的生成时间。研究团队指出,在单块 B200 上,每次 MiniMax-H3 去噪步骤中,attention 大约占据三分之二的时间。

低比特 Tensor Core 可以加速 QK 和 PV 两次矩阵乘法,但仍有两大障碍。首先,此前的方法(如 SageAttention2)会对 query 和 key 进行平滑处理。经过 QK 平滑和旋转后,value 项在 Wan2.2 上占据了 82% 的输出误差。其次,两次矩阵乘之间的 softmax 仍以 FP32 运行。在 B200 和 H200 上,指数运算及其 FP8 转换成为了最耗时的流水线阶段。

V-Smooth:解决 Value 离群值问题

Value 离群值集中在少量 token 中,且其通道在 heads、层和步骤之间会发生变化。Hadamard 旋转能保持 token 范数,因此无法消除它们。旋转 V 只会在 value 误差上增加 0.2%。

V-Smooth 走了另一条路:

  • 分组(Group):对每个 batch 和 head 中的 value token 执行在线 k-means 聚类。Key 和 value 一起做置换,因此非因果 attention 的输出不变。
  • 去均值(Demean):每个 128-token 的硬件块减去其均值。只对残差做量化,使用 per-channel E4M3(8 比特)或 NVFP4(4 比特)。
  • 恢复(Restore):利用行式在线 softmax 已经保留的行和,将均值加回。不需要第二次遍历或额外缓冲区。

在 100 个 Wan2.2 head 上取平均后,块均值在序列顺序上去除了 8% 的块能量。在 DeltaQuant 静态立方体下去除了 12%,排序后去除了 36%。每个均值对每个 value 元素花费 0.125 比特。

分组操作只在去噪步骤的前 25% 中运行。置换在相邻的 4 个步骤中复用。在完整调度上取平均,分组操作占 attention 时间的 3% 到 4%。

ExpCast-FP8:移除 Softmax 瓶颈

一个 E4M3 字节已经接近它所存储值的对数。以整数方式读取时,它大约等于 8 log₂(v) + 56。因此 ExpCast-FP8 直接从对数域分数写出字节,只需 1 次融合乘加。常数 β = -0.35 将剩余误差居中,不需要为每个模型拟合常数。

在每次倍增的 79.6% 上,直接路径写出的字节与 FP32 先指数后转换路径完全一致。其余情况也只差 1 个码。论文证明了每行总变差小于 3.64% 的界限,加上任何下溢尾分布。在 204.8K 行 Wan2.2 attention 上,实测平均值为 1.6%。ExpCast-FP8 只适用于 8 比特内核,因为 NVFP4 没有单一的仿射对数到码的映射。

手写的 CuTe/CUDA 预处理链 fusion 将一次 V-Smooth 调用在 B200 上从 42.2ms 削减到 4.8ms。

解析:VC-Attention 的工作原理

测试覆盖了 4 个开源视频 DiT:Wan2.2-T2V-A14B、LongCat-Video、HunyuanVideo-1.5 和 MiniMax-H3。保真度以 BF16 FlashAttention-4 输出为基准,在 100 条提示词上打分。

GPU 精度 Attention 加速比 端到端加速比
B200 8-bit 1.59× 1.19×
H200 8-bit 1.46× 1.13×
RTX PRO 6000 4-bit 2.27× 1.36×
RTX 5090 4-bit 3.58× 1.70×

在 B200 上,VC-Attention 比 SageAttention2 快 6.02 倍,而 SageAttention2 没有提供 Blackwell 内核。在 H200 上,差距为 1.16 倍。在工作站显卡上,4 比特 V-Smooth 在 RTX PRO 6000 上与 SageAttention3 持平。在 RTX 5090 上保持在 5% 以内,保真度差异将两者区分开来。

在 8 比特下,V-Smooth 在 Wan2.2 上比 SageAttention2 高出 2.3 dB PSNR,在 HunyuanVideo-1.5 上高出 2.8 dB。

加上 ExpCast-FP8 可以恢复 0.7 到 2.1 dB,但在所有 4 个模型上仍然胜过 SageAttention2。

在 4 比特下,V-Smooth 在 Wan2.2 上比 SageAttention3 高出 2.9 dB,在 LongCat-Video 上高出 3.6 dB。

以训练-free 方式运行时,Attn-QAT 比 SageAttention2 低 3.4 到 6.7 dB。

在 MiniMax-H3(1344×768)上,attention 在 B200 上比 BF16 FlashAttention-4 快 1.60 倍。PSNR 为 20.2 dB,而 SageAttention2 为 19.9 dB。在 B300 上,论文报告为 1.47 倍相比朴素 FP8 内核的 1.31 倍。博客图表列出 B300 为 1.51 倍。

Nunchux Attention(Nunchux 的专有扩展)在 B200 上对 MiniMax-H3 attention 达到 1.91 倍,在 B300 上达到 1.83 倍。

该方法只改变每次交互的成本。因此可以与 Sparse VideoGen 和 Radial Attention 等稀疏注意力机制、以及蒸馏和多 GPU 执行组合使用。Nunchux 表示将过 Modelverse 等待名单提供免费的 MiniMax-H3 访问。

总结

VC-Attention 是 Nunchux AI 为视频 DiT 打造的训练-free 低比特 attention 内核。

V-Smooth 对 value token 聚类,然后在块均值减去后只量化残差。

ExpCast-FP8 用 1 次乘加替换了 FP32 指数和转换操作。

Wan2.2 attention 在 B200 上快 1.59 倍,在 RTX 5090 上快 3.58 倍。

目前尚无公开内核发布;Nunchux 在其栈中运行专有扩展。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
提取 DeepSeek R1 的思维链:CoT 清洗与推理日志导出指南
下一篇
GitHub Copilot 800 KLOC 运行时全面迁移 Rust,AI 编程工具进入生产级工程阶段