Kandinsky 6.0 Video

厂商 / 系列
Kandinsky LabKandinsky
上下文
—
输入价
—
输出价
—
许可
开源

快速对比

选择一个模型,与 Kandinsky 6.0 Video 并排比较关键规格。

浏览视频模型

COMPARE MATRIX · 横向比较

模型比较

并列查看 0 项模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

Kandinsky 6.0 Video 是 Kandinsky Lab 推出的音视频同步生成基础扩散模型家族,包含 Kandinsky 6.0 Video Lite(30 亿参数)和 Kandinsky 6.0 Video Pro(290 亿参数)。两者都能在文本到音视频、图像到音视频两种模式下生成 5 秒视频片段,并同步生成 44 kHz 音频(包括口型同步);配套的超分模型可把画面提升到 1920×1080。它在 Kandinsky 5.0 Video 的视频能力之上采用双流 CrossDiT 架构,用双向交叉注意力把预训练的视频流和新训练的音频流在时间与语义上对齐;训练上先在大规模音频语料上从零训练音频流,再在成对音视频数据上联合训练,随后进行 SFT、基于强化学习的后训练与蒸馏。官方人工并排评测称 6.0 Video Pro 明显优于上代 5.0 Video Pro,并与领先的音视频生成模型具备竞争力,语音质量尤为突出(官方数据,尚待第三方评测)。技术报告 arXiv:2610.05608(2026-10-04 提交),GitHub 仓库于 2026-10-06 宣布开源,同日新增 vLLM-Omni 支持与 Hugging Face Space(Kandinsky-6.0-Pro-distill-5s)。 本地运行需要 NVIDIA GPU 与 Python 3.13/3.14,并安装 uv 与 just:git clone https://github.com/kandinskylab/kandinsky-6.git,进入目录后执行 just setup(自动按 GPU 安装 CUDA 13.0 版 PyTorch,H100/H200 用 FlashAttention 3,Ampere/Ada/消费级 Blackwell 编译 SageAttention),再运行 just download pro-distill 和 just generate "a cat on a mat";首次运行权重默认下载到 ~/.cache/kandinsky,输出为 outputs/generate_<时间>/generations/output.mp4,可选 pro、pro-pretrain、lite、lite-distill、lite-pretrain 等检查点,RTX 5090 等显卡有现成配置预设。ComfyUI 用户可在 ComfyUI Manager 中安装 kandinsky6 与 kandinsky6-sr 节点。官方实测(非蒸馏版、5 秒片段):H100 上 Lite SD 约 239 秒、Pro Full HD 约 402 秒;RTX 4090 上 Lite SD 约 437 秒、Pro Full HD 约 1247 秒。 可用状态:代码、模型检查点与 Diffusers 集成均以 MIT 许可开源,可在 Hugging Face(kandinskylab)下载;官方未提供付费 API,价格与上下文字段不适用、留空。来源:github.com/kandinskylab/kandinsky-6 README、arxiv.org/abs/2610.05608、huggingface.co/kandinskylab(2026-10-06 核对)。

模态
视频
许可说明
开源 · 开源(MIT,代码+权重+Diffusers 集成)

能力

  • 文本到音视频(T2AV)与图像到音视频(I2AV)两种模式
  • 一次生成 5 秒视频片段,同步 44 kHz 音频,含对白口型同步
  • Lite 3B 与 Pro 29B 两档,另有蒸馏版(distill)与预训练版
  • 内置超分模型,可把输出提升到 Full HD 1920×1080
  • 双流 CrossDiT 架构:预训练视频流与新训练音频流通过双向交叉注意力对齐
  • 支持 Diffusers、ComfyUI 节点(kandinsky6 / kandinsky6-sr)、vLLM-Omni,Hugging Face 有在线 Demo