Step-Video-T2V

厂家 / 系列
阶跃星辰Step-Video
上下文
输入价
输出价
许可
开源

快速对比

Step-Video-T2V 固定为第一列,选择一个候选即可并列查看关键规格。

查看 Step-Video 系列对比

COMPARE MATRIX · 横向比较

模型比较

并列查看 0模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

Step-Video-T2V 是阶跃星辰(StepFun)于 2025 年 2 月 17 日以 MIT 许可开源的文生视频模型,参数量 300 亿,单条最长可生成 204 帧,支持 768×768(204 帧)、544×992(204 帧 / 136 帧)等配置。架构上采用深度压缩 Video-VAE(空间 16×16、时间 8 倍压缩)与带 3D 全注意力的 DiT,并用直接偏好优化(DPO)提升生成质量。团队同时开源了评测集 Step-Video-T2V-Eval:128 条中文提示,覆盖运动、动物、影视镜头、超现实等 11 个类别。衍生版本包括推理步数蒸馏的 Step-Video-T2V-Turbo 与 2025 年 3 月 17 日发布的图生视频模型 Step-Video-TI2V。

模态
视频
参数量
30B
许可说明
开源 · MIT

能力

  • 文生视频,单条最长 204 帧
  • 支持 768×768、544×992 等多种分辨率配置
  • 深度压缩 Video-VAE:空间 16×16、时间 8× 压缩比
  • DiT + 3D 全注意力架构,并用直接偏好优化(DPO)提升画质
  • 配套开源中文视频生成评测集 Step-Video-T2V-Eval