概览
TwelveLabs 的视频语言模型新版本:直接「看」视频或 1–20 张图片后生成文字、JSON 结构化结果和带时间戳的分段,新增第一人称(可穿戴 / 遥操作相机)视频理解,主要面向机器人与具身智能训练数据的动作标注和质检。 能力要点:第一人称视频理解:分析可穿戴相机、遥操作系统拍摄的第一视角画面,用于动作标注、质检和下一步动作预测;图像分析:每次请求可分析 1–20 张图片(JPEG / PNG / WebP / GIF / BMP,单张 ≤20 MB),用于对比商品图、场景和示意图;实体识别更稳定:比 Pegasus 1.5 更一致地识别和命名画面中的人物、物体和角色;元数据抽取改进:对分段定义的依赖更低,一次分析可抽取更丰富的字段;段内事件:视频分段时,每个分段内再输出带时间戳的事件列表;分段不受 token 上限限制:长视频分段即使输出不完整也会返回已生成的分段;上下文窗口 261,120 token(输入与输出合计,视频、音频转写、提示词、参考图、JSON Schema 都计入);视频最长 2 小时(只分析其中一段时最长 4 小时),≤10 GB,分辨率 360×360 至 5184×2160;语言:英语完整支持;中文、日语、韩语、阿拉伯语、法语、德语、西班牙语等 12 种语言部分支持。 Pegasus 1.6 是 TwelveLabs 于 2026 年 10 月 6 日发布的生成式视频理解模型(官方发布说明与博客「What's New: Pegasus 1.6」同日上线),10 月 7 日登上 Product Hunt 当日榜第 5 名,宣传语是「把第一人称视频变成机器人训练数据」。Pegasus 系列负责「看视频、写文字」:视频问答、摘要、打标签、分段和结构化抽取;同公司的 Marengo 系列负责向量检索,两者配合使用。 这一版的重点是具身智能:机器人和人形机器人公司大量采集第一人称(头戴相机、遥操作)视频,人工逐帧标注成本很高。Pegasus 1.6 可以对这类画面做动作标注(例如「00:02 抓起瓶子 · 右手」「00:04 拧开瓶盖 · 双手」)、按预期行为做质检、预测操作者下一步动作。另一项变化是开始支持纯图像输入,每次 1–20 张。视频分段功能也有改进:每个分段内可以再列出带时间戳的事件,分段输出不再受 token 上限截断(max_tokens 可设为 unlimited,配合 time_based_metadata 使用)。 价格(Developer 按量计费,Pegasus 1.6 档):视频输入 $1.75 / 小时,图像输入 $3 / 百万 token,输出 $7.50 / 百万 token;Free 套餐有 600 分钟(10 小时)免费索引额度,无需绑卡;Enterprise 定制。视频按时长计费,与按 token 计价的模型不可直接比较。限制:批量分析(batch analysis)暂不支持 1.6,需继续用 Pegasus 1.5;请求里不写模型名时默认仍是 Pegasus 1.5。 上手方式:升级 SDK(pip install --upgrade twelvelabs 或 npm install twelvelabs-js@latest),在 analyze 调用里把 model_name 从 "pegasus1.5" 改成 "pegasus1.6",其余参数不变;REST 端点为 https://api.twelvelabs.io/v1.3/analyze。来源:docs.twelvelabs.io Pegasus 1.6 模型页、Pegasus 1.5 → 1.6 迁移指南、发布说明,twelvelabs.io/pricing,twelvelabs.io 博客(2026-10-08 核对)。 API ID:pegasus1.6(TwelveLabs API v1.3 的 model_name);最大输出:官方未单独公布(上下文 261,120 token 含输入与输出);视频输入按时长计费 $1.75/小时。
- 模态
- 多模态
- 许可说明
- 闭源 · 闭源
能力
- 第一人称视频理解:分析可穿戴相机、遥操作系统拍摄的第一视角画面,用于动作标注、质检和下一步动作预测
- 图像分析:每次请求可分析 1–20 张图片(JPEG / PNG / WebP / GIF / BMP,单张 ≤20 MB),用于对比商品图、场景和示意图
- 实体识别更稳定:比 Pegasus 1.5 更一致地识别和命名画面中的人物、物体和角色
- 元数据抽取改进:对分段定义的依赖更低,一次分析可抽取更丰富的字段
- 段内事件:视频分段时,每个分段内再输出带时间戳的事件列表
- 分段不受 token 上限限制:长视频分段即使输出不完整也会返回已生成的分段
- 上下文窗口 261,120 token(输入与输出合计,视频、音频转写、提示词、参考图、JSON Schema 都计入)
- 视频最长 2 小时(只分析其中一段时最长 4 小时),≤10 GB,分辨率 360×360 至 5184×2160
- 语言:英语完整支持;中文、日语、韩语、阿拉伯语、法语、德语、西班牙语等 12 种语言部分支持
