旗舰版 Kandinsky 6.0 Video Pro 和紧凑版 Kandinsky 6.0 Video Lite 的代码与权重已根据 MIT 许可证开
Sberbank 推出了 Kandinsky 6.0 Video,这是一系列可生成带同步声音的视频的新模型,并根据 MIT 许可证发布了代码和模型权重:任何人都可以免费使用这些模型,并在此基础上构建自己的产品。该系列包括两个模型——拥有 290 亿参数的旗舰版 Kandinsky 6.0 Video Pro 和拥有 30 亿参数的轻量版 Kandinsky 6.0 Video Lite。两者都能创建包含对话、音乐和环境音的视频:音轨与画面中发生的内容同步,角色的唇部动作与他们的语音相匹配。要获得带配音的成品片段,只需用文字描述一个场景,或上传第一帧并添加对音轨的描述。带声音片段的最大时长为五秒,开发者计划随着时间推移增加这一时长。Kandinsky 已成为俄罗斯首个能够生成音画同步视频的神经网络。

模型能力
Kandinsky 6.0 Video 是一个多模态模型,能够同时“看到”和“听到”它生成的内容。因此,对话、效果音和背景音乐都与画面同步,角色的嘴唇也会随语音同步运动。如果不需要声音,也可以要求神经网络创建无声音视频。
Kandinsky 能够生成范围广泛的自然声音:从语音和数字音效,到脚步声、风声或汽车驶过的声音。该模型生成的声音清晰且细节丰富,没有“嘶嘶声”或质量损失:采样率达到 44 kHz,符合大多数流媒体服务的标准。
这些能力适用于各种各样的任务:例如,可以让家庭照片活起来,为亲人录制带语音或音乐的视频问候,拍摄带有纸张沙沙声、木柴噼啪声或积雪嘎吱声的 ASMR 视频,或者让旧梗图或电影画面动起来。
产品系列
Kandinsky 6.0 Video Pro 是该系列的旗舰版。凭借 290 亿参数,它提供最高的生成质量:从文本或图像创建带 44 kHz 声音和唇同步的五秒片段,并内置超分辨率模块将画面提升至 Full HD。在人工对比测试中,Pro 模型在所有评估标准上都明显优于其前代 Kandinsky 5.0 Video Pro。它在视觉质量和语音质量上击败了开源模型 LTX 2.5,在开放模型中仅落后于 MiniMax H3。在图像动画任务中,Kandinsky 6.0 Video Pro 在视觉质量、对源图像的遵循度以及镜头运动方面超越了领先的闭源模型 Veo 3.1 Fast。
Kandinsky 6.0 Video Lite 是拥有 30 亿参数的轻量版。它共享旗舰版的架构和能力——同样带同步声音、唇同步以及可放大至 Full HD 的五秒片段——但经过适配,可在消费级 NVIDIA 显卡上运行,从 RTX 5060 Ti 到 RTX 5090,并带有适用于 16、24 和 32 GB 显存的现成预设。得益于块卸载技术,即通过 GPU 分批流式加载模型权重,两个模型甚至可以在家用电脑上启动。
视频质量
两个模型都能生成最高达 Full HD 分辨率的片段:基础生成以 SD 运行,内置超分辨率模块将图像提升至 HD 或 Full HD,从而在速度与细节之间取得平衡。Kandinsky 6.0 Video 能更准确地传达现实世界的物理规律。片段中人物、动物和物体的运动看起来更自然,整个场景也更逼真。这在快速运动或镜头角度变化的动态片段中尤为明显。
模型是如何训练的
Kandinsky 6.0 Video 由两个相互连接的模块组成,分别负责生成视频和声音。音频模块首先在 4000 万条音轨上从零开始训练,然后与视频模块在 700 万个配对的音视频片段上进行联合训练。为了训练,团队只选择了声音干净、高质量的片段,以及包含说话人物特写镜头的视频,以便更精确地同步语音和面部表情。强化学习后训练使 Pro 模型生成语音的词错误率降低了 47%。
Kandinsky 的上一版本曾在 arena.ai 的文本生成视频类别中,在开放模型里保持第一名超过六个月。
(免责声明:本文为本网站出于广告目的进行转载发布,不代表本网站的观点及立场。本文所涉文、图、音视频等资料之一切权力和法律责任归材料提供方所有和承担。本网站对此咨询文字、图片等所有信息的真实性不作任何保证或承诺,亦不构成任何购买、投资等建议,据此操作者风险自担。)
评论