Kandinsky 5 关闭了旧 issue,但实际部署问题未解决。揭示 open weights 模型将集成复杂性转嫁给部署者,需自行处理 CUDA、内存、驱动等多层依赖。
7月16日,Kandinsky 5仓库一次关闭了几个旧的运行时issue:关于I2V中的OOM、在Windows上导入torch和torchvision、与NumPy的冲突。对于打算下载权重的人来说,这看起来是个好信号:Kandinsky在发展,老的障碍已经消除。
但在关闭当天,这些讨论中并没有出现维护者的新解决方案。这意味着实际的解决方案并没有改变:在下载权重之前,你需要检查具体的pipeline、你的操作系统、CUDA的可见性、torch和torchvision的组合,以及内存消耗路径。关闭状态只是描述了跟踪器中的一条记录。它并不能证明inference会在你的机器上成功运行。
截至固定时间点,Kandinsky 5仓库有796颗星和60个fork。这表明了项目受关注的程度,但不是一个兼容性表。开源权重将大量集成工作转移给了运行模型的人:正是他需要连接权重、代码、驱动程序、CUDA、库和内存限制。
这在issue №61中表现得特别明显。它描述了在具有80GB内存的A100上进行I2V时发生OOM的情况,尽管进行了offloading和MagCache。在同一讨论中,提到了一个更旧的替代方案,据参与者说,它在Linux下的4090上能运行。这既无法得出最小VRAM容量,也无法得出通用配方:pipeline、模式、环境和内存管理方式都不同。
结论令人不快但很有用:「显存够吗?」这个问题太粗糙了。对于kandinsky video,更重要的是问:你到底在运行哪个pipeline、在什么输入上、什么配置下、以及峰值出现在哪里:是在加载时、DiT中、VAE中,还是在解码结果时。

Issue №108展示了第二个陷阱。导入错误与torch和torchvision版本不匹配有关,但在此之后,出现了一个独立的Windows上CUDA设备问题。解决第一个错误并不能证明模型已准备好生成。
这是本地运行的典型结构:早期的错误会阻止访问下一个错误。因此,成功的导入不应与inference就绪混淆,GPU在系统中的出现也不应与所选PyTorch构建能看到它混淆。
这里有个强有力的反对意见是正当的:关闭的issue仍然很有用。它们消除了重复,固定了讨论的边界,有时会显示问题已过时或已转移到其他地方。忽视它们是不明智的。错误从另一个点开始:当把卡的状态当作可重现测试的结果时。
在大规模下载和设置之前,通过五个简短的检查点很有用。其目的不是证明Kandinsky的通用工作能力,而是快速为你的配置获得答案。
创建一个干净的环境,并固定选择的torch和torchvision版本。
创建一个干净的环境,并固定选择的torch和torchvision版本。
选择确切的pipeline及其配置。不要将一个任务的结论转移到另一个任务,特别是在图像和I2V之间。
选择确切的pipeline及其配置。不要将一个任务的结论转移到另一个任务,特别是在图像和I2V之间。
检查在将运行模型的同一环境中CUDA的可见性。
检查在将运行模型的同一环境中CUDA的可见性。
不进行生成地执行导入。如果失败,不要转到有关质量、内存或提示的讨论。
不进行生成地执行导入。如果失败,不要转到有关质量、内存或提示的讨论。
运行一个微小的支持的生成并记录峰值内存消耗。只有在此之后,增加输入参数才有意义。
运行一个微小的支持的生成并记录峰值内存消耗。只有在此之后,增加输入参数才有意义。
这样的测试改变了成本顺序。与其首先下载所有内容、调整标志并在线程中寻求建议,不如首先确定故障的类别:依赖性、设备、pipeline或内存。如果故障停留在早期阶段之一,「issue已关闭」这句话并不会带来解决方案。
本地Kandinsky 5是合理的,当目标本身要求对环境的控制:研究pipeline、可重现的实验、集成到自己的堆栈或验证权重的行为。那么烟雾测试是工作的一部分,而不是令人讨厌的延迟。
但如果你只需要一个有限的图像生成任务,而不是研究本地运行时,最好分离目标和工具。托管路由不会修复仓库依赖关系,也不会将其转变为本地运行时,但可以从当前任务中消除组装此环境的必要性。对于这样的结果检查,你可以使用provod.ai。
主要界线很简单:关闭的issue可能是一个有用的阅读信号,但本地就绪只有在你的最小pipeline达到了具有固定内存的小生成时才开始。

provod.ai — 世界AI目录,支持俄罗斯付款
无需国外银行卡和复杂的支付方案即可连接所需模型:访问权限通过俄罗斯平台运作,余额以卢布充值。
一个目录中包含最新的文本和媒体模型:OpenAI的GPT、Anthropic的Claude、Google的Gemini、xAI的Grok、DeepSeek、Qwen、GLM、Kimi和MiniMax;用于图像的Nano Banana 2 Pro和GPT Image;用于视频的最新版本Seedance、Kling、Veo和Google Omni。还提供用于推理、搜索、文档、嵌入、音乐和音频的模型。
俄罗斯付款方式不会增加模型本身的成本:价格对应官方费率1:1,provod.ai不收取额外费用。
开始工作,无需付款障碍:注册表单 · 模型价格 · 根据152-ФЗ的数据保护 · provod.ai主页
对于你的下一个任务,哪个成本更高:花时间打造一个可重现的本地堆栈,还是为了有限任务的结果而放弃它?