Gemini 3.5 Transcribe

厂家 / 系列
GoogleGemini
上下文
输入价
$2.00 / 百万 tokens
输出价
$12.00 / 百万 tokens
许可
闭源

快速对比

Gemini 3.5 Transcribe 固定为第一列,选择一个候选即可并列查看关键规格。

查看 Gemini 系列对比

COMPARE MATRIX · 横向比较

模型比较

并列查看 0模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

Google 于 2026-08-26 在 Gemini API 上线的语音转写模型,一次发布两个端点:gemini-3.5-transcribe 走 Interactions API 处理已录音频,gemini-3.5-transcribe-live 走 Live API 做 WebSocket 流式转写。它不只是转写,smart 模式还会把口语「整理成稿」:删填充词、去口吃与说错重来,并自动把列表、日期、货币排版规整。支持 85 种以上语言与地区变体、自动语种识别,说话人分离最多 8 人(3 人及以上为实验特性),可选词级时间戳。单次请求音频上限 1 小时,开启说话人分离或词级时间戳时降到 30 分钟。计价:输入 $2.00 / 百万 token(或按 $0.003 / 分钟音频),输出 $12.00 / 百万 token(或 $0.002 / 分钟),有免费额度;流式档 gemini-3.5-transcribe-live 为 $3.50 / $21.00。

模态
音频

能力

  • 语音转文字,支持 85 种以上语言与地区变体,可自动识别语种
  • smart 模式自动清理口头语:去掉填充词、口吃与说错重来,并自动排版列表、日期与货币
  • 说话人分离最多支持 8 人(3 人及以上为实验特性)
  • 可开启词级时间戳(会略微影响整体准确率)
  • 两套接口:Live API(gemini-3.5-transcribe-live,WebSocket 流式)与 Interactions API(gemini-3.5-transcribe,处理已录音频)
  • 单次请求音频最长 1 小时;开启说话人分离或词级时间戳时限 30 分钟