Gemini 3.5 Transcribe
- 上下文
- —
- 输入价
- $2.00 / 百万 tokens
- 输出价
- $12.00 / 百万 tokens
- 许可
- 闭源
概览
Google 于 2026-08-26 在 Gemini API 上线的语音转写模型,一次发布两个端点:gemini-3.5-transcribe 走 Interactions API 处理已录音频,gemini-3.5-transcribe-live 走 Live API 做 WebSocket 流式转写。它不只是转写,smart 模式还会把口语「整理成稿」:删填充词、去口吃与说错重来,并自动把列表、日期、货币排版规整。支持 85 种以上语言与地区变体、自动语种识别,说话人分离最多 8 人(3 人及以上为实验特性),可选词级时间戳。单次请求音频上限 1 小时,开启说话人分离或词级时间戳时降到 30 分钟。计价:输入 $2.00 / 百万 token(或按 $0.003 / 分钟音频),输出 $12.00 / 百万 token(或 $0.002 / 分钟),有免费额度;流式档 gemini-3.5-transcribe-live 为 $3.50 / $21.00。
- 模态
- 音频
能力
- 语音转文字,支持 85 种以上语言与地区变体,可自动识别语种
- smart 模式自动清理口头语:去掉填充词、口吃与说错重来,并自动排版列表、日期与货币
- 说话人分离最多支持 8 人(3 人及以上为实验特性)
- 可开启词级时间戳(会略微影响整体准确率)
- 两套接口:Live API(gemini-3.5-transcribe-live,WebSocket 流式)与 Interactions API(gemini-3.5-transcribe,处理已录音频)
- 单次请求音频最长 1 小时;开启说话人分离或词级时间戳时限 30 分钟
