Pegasus 1.6

厂商 / 系列
TwelveLabs独立模型
上下文
261K
输入价
—
输出价
$7.50 / 百万 tokens
许可
闭源

快速对比

选择一个模型,与 Pegasus 1.6 并排比较关键规格。

浏览多模态模型

COMPARE MATRIX · 横向比较

模型比较

并列查看 0 项模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

TwelveLabs 的视频语言模型新版本:直接「看」视频或 1–20 张图片后生成文字、JSON 结构化结果和带时间戳的分段,新增第一人称(可穿戴 / 遥操作相机)视频理解,主要面向机器人与具身智能训练数据的动作标注和质检。 能力要点:第一人称视频理解:分析可穿戴相机、遥操作系统拍摄的第一视角画面,用于动作标注、质检和下一步动作预测;图像分析:每次请求可分析 1–20 张图片(JPEG / PNG / WebP / GIF / BMP,单张 ≤20 MB),用于对比商品图、场景和示意图;实体识别更稳定:比 Pegasus 1.5 更一致地识别和命名画面中的人物、物体和角色;元数据抽取改进:对分段定义的依赖更低,一次分析可抽取更丰富的字段;段内事件:视频分段时,每个分段内再输出带时间戳的事件列表;分段不受 token 上限限制:长视频分段即使输出不完整也会返回已生成的分段;上下文窗口 261,120 token(输入与输出合计,视频、音频转写、提示词、参考图、JSON Schema 都计入);视频最长 2 小时(只分析其中一段时最长 4 小时),≤10 GB,分辨率 360×360 至 5184×2160;语言:英语完整支持;中文、日语、韩语、阿拉伯语、法语、德语、西班牙语等 12 种语言部分支持。 Pegasus 1.6 是 TwelveLabs 于 2026 年 10 月 6 日发布的生成式视频理解模型(官方发布说明与博客「What's New: Pegasus 1.6」同日上线),10 月 7 日登上 Product Hunt 当日榜第 5 名,宣传语是「把第一人称视频变成机器人训练数据」。Pegasus 系列负责「看视频、写文字」:视频问答、摘要、打标签、分段和结构化抽取;同公司的 Marengo 系列负责向量检索,两者配合使用。 这一版的重点是具身智能:机器人和人形机器人公司大量采集第一人称(头戴相机、遥操作)视频,人工逐帧标注成本很高。Pegasus 1.6 可以对这类画面做动作标注(例如「00:02 抓起瓶子 · 右手」「00:04 拧开瓶盖 · 双手」)、按预期行为做质检、预测操作者下一步动作。另一项变化是开始支持纯图像输入,每次 1–20 张。视频分段功能也有改进:每个分段内可以再列出带时间戳的事件,分段输出不再受 token 上限截断(max_tokens 可设为 unlimited,配合 time_based_metadata 使用)。 价格(Developer 按量计费,Pegasus 1.6 档):视频输入 $1.75 / 小时,图像输入 $3 / 百万 token,输出 $7.50 / 百万 token;Free 套餐有 600 分钟(10 小时)免费索引额度,无需绑卡;Enterprise 定制。视频按时长计费,与按 token 计价的模型不可直接比较。限制:批量分析(batch analysis)暂不支持 1.6,需继续用 Pegasus 1.5;请求里不写模型名时默认仍是 Pegasus 1.5。 上手方式:升级 SDK(pip install --upgrade twelvelabs 或 npm install twelvelabs-js@latest),在 analyze 调用里把 model_name 从 "pegasus1.5" 改成 "pegasus1.6",其余参数不变;REST 端点为 https://api.twelvelabs.io/v1.3/analyze。来源:docs.twelvelabs.io Pegasus 1.6 模型页、Pegasus 1.5 → 1.6 迁移指南、发布说明,twelvelabs.io/pricing,twelvelabs.io 博客(2026-10-08 核对)。 API ID:pegasus1.6(TwelveLabs API v1.3 的 model_name);最大输出:官方未单独公布(上下文 261,120 token 含输入与输出);视频输入按时长计费 $1.75/小时。

模态
多模态
许可说明
闭源 · 闭源

能力

  • 第一人称视频理解:分析可穿戴相机、遥操作系统拍摄的第一视角画面,用于动作标注、质检和下一步动作预测
  • 图像分析:每次请求可分析 1–20 张图片(JPEG / PNG / WebP / GIF / BMP,单张 ≤20 MB),用于对比商品图、场景和示意图
  • 实体识别更稳定:比 Pegasus 1.5 更一致地识别和命名画面中的人物、物体和角色
  • 元数据抽取改进:对分段定义的依赖更低,一次分析可抽取更丰富的字段
  • 段内事件:视频分段时,每个分段内再输出带时间戳的事件列表
  • 分段不受 token 上限限制:长视频分段即使输出不完整也会返回已生成的分段
  • 上下文窗口 261,120 token(输入与输出合计,视频、音频转写、提示词、参考图、JSON Schema 都计入)
  • 视频最长 2 小时(只分析其中一段时最长 4 小时),≤10 GB,分辨率 360×360 至 5184×2160
  • 语言:英语完整支持;中文、日语、韩语、阿拉伯语、法语、德语、西班牙语等 12 种语言部分支持