小米推出RC-S/RC-T感知对齐指标及真实视频基准,解决现有评估指标与人类感知不一致的问题。
Object removal 模型的发展速度已经超过了用于评判它们的指标。Diffusion eraser 现在能够令人信服地重建阴影、反光和被遮挡的结构,但 PSNR、SSIM、LPIPS、ReMOVE 和 CFD 往往会对它们的输出给出错误的排名。根本原因在于结构层面: erasure 是一个不适定的、一对多的任务,因此不存在可以对比的单一真值。Xiaomi 公司 MiLM Plus 团队发布了 PROVE(Perceptual RemOVal cohErence),已被 ACM MM 2026 录用,填补了这一空白。PROVE 搭配两个感知对齐的指标——RC-S 用于空间一致性,RC-T 用于时序一致性——以及 PROVE-Bench,这是一个双层真实世界视频基准。两个指标均在编辑区域本地评分,使用 DINOv2 特征的滑动窗口最大均值差异,且均不需要参考视频。
是的——作为评估工具箱,而非产品特性。PROVE 以 Apache 2.0 PyTorch 仓库形式发布,包含一个 CLI 入口(run_prove_metrics.py)。需要 Python 3.10+、PyTorch 2.6+、Transformers 4.51+ 以及 DINOv2-giant 权重。遮罩是必需的;白色像素标记被移除的物体。
公司层面:任何拥有单 GPU 和遮罩流水线的团队即可。RC-S 在单张 RTX 4090 上运行速度为 134.6 ms/帧,因此对创业公司来说做夜间 CI 门控是可行的;拥有大量编辑目录的企业获益最多,因为无需配对真值。
行业:智能手机相册和相机应用、短视频编辑、电商目录清理、广告和库存媒体、电影/VFX 后期制作、房产图像以及地图档案中的隐私涂白。
应用场景:模型对比、RC-S/RC-T 的 CI 门控、在无参考视频的情况下调优推理步数或量化、过滤训练数据以及塑造奖励模型。
目标用户:CV 研究人员和应用 AI/ML 工程师最先;将分数接入 CI 的 MLOps 工程师次之;运行供应商对比的产品经理第三。
不适用场景:设备端实时评分,以及延伸至裁剪评估区域外的大面积阴影或反光等副作用。
Object removal 是不适定的、一对多的:同一个空洞可能有多种合理的修复方案,因此不存在唯一的真值。
全参考偏差:PSNR、SSIM 和 LPIPS 假设点对点对应关系,因此它们会奖励复制粘贴而非真正的擦除。残余阴影只占据少量像素,几乎不会受到惩罚。更糟的是,减少 diffusion 推理步数会改善 PSNR 和 SSIM,而视觉质量却会崩溃——即向均值回归。
无参考盲区:在 ROSE-Bench 上,作者对遮罩区域进行渐进式模糊。ReMOVE 和 CFD 均不会退化;两者最终都超过了未模糊的基线。CFD 基于 SAM 的幻觉项也会误触发:合法修复的自行车座椅被标记为幻觉,评分反而比未编辑的输入更差。
时序不敏感:Temporal Consistency 和 Temporal Flickering 在全帧特征上运作。由于编辑区域只占帧的一小部分,在 DAVIS 上注入的 Random Drop 和 Random Replace 腐败几乎无法移动它们,有时甚至会反向移动。
RC-S(空间):连通分量分析将遮罩分割为独立目标。每个边界框按其边长的三分之一扩展,裁剪后送入 DINOv2,并将遮罩下采样至特征分辨率。一个 w×w 窗口在特征图上滑动,在遮罩区域特征与局部背景特征之间计算高斯 RBF 核的平方最大均值差异。每个目标的分数取平均,然后再跨目标汇总。
RC-T(时序):相邻帧在它们遮罩的并集下联合裁剪以避免错位,然后仅在交集中计算 MMD——即两帧中都得到修复的区域。消融实验表明,去除裁剪会使 RC-T 对注入的腐败失去感知能力。
在与 20 名参与者通过 Borda count 聚合的人类排名对比中,RC-S 达到了 0.59 的平均 Kendall's τ 和 0.66 的 Spearman's ρ,而 ReMOVE 为 0.26/0.29,CFD 为 0.16/0.18。它在六个基准中的五个上排名第一。仅背景的 FR 变体在大多数数据集上呈负相关。在 RORD-Val 上,RC-S 在 100% 的情况下偏好干净图像而非模糊和区域交换变体;ReMOVE 在模糊下仅达到 60.06%,CFD 为 49.27%。RC-T 对上升的腐败呈单调响应,而 TC 和 TF 则不然。
消融实验隔离了各项贡献:DINOv2(0.59 平均 τ)击败了 DINOv3(0.51)和 SAM(0.44);去掉滑动窗口损失 0.11;将 MMD 替换为余弦相似度损失 0.07。RC-S 也是测试中最便宜的空间指标,比 CFD 快 13.7 倍。
PROVE-M 包含 80 个配对视频:三脚架拍摄的输入和两分钟内拍摄的无真值素材、逐帧精修的 SAM3 遮罩、三阶段质量控制,然后对三元组同步应用 Ken Burns 风格运动增强。每个片段为 81 帧 1080p。PROVE-H 新增 100 个无真值的困难视频——人群、流水、火焰、纹理地形、多水坑反光、快速运动——故意使用未精修的 SAM3 遮罩。
在公开排行榜上,SVOR(1.3B)在综合 RC-S 上以 0.5197 领先;EffectErase 在 RC-T 上以 0.2525 领先。
查看 Paper、GitHub Repo、Project Page 和 Dataset。也欢迎关注我们的 Twitter,别忘了加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们。
Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借统计分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。