Gemini 3.5 Transcribe是Google DeepMind于2026年8月26日推出的专用语音转文本模型,通过Gemini API面向开发者开放,同时覆盖实时流式与录制音频两类管线。它解决的是转写场景里几个长期存在的具体难题:背景噪音干扰、专业术语识别不准、口语停顿与语气词混入正文。模型能把原始音频直接转换为格式规范的文本,自动剔除「嗯」「啊」这类口头禅,输出接近可直接使用的书面结果,而不是需要大量后处理的原始转写流。能力清单上有四项关键特性。语句级语种检测覆盖超过85种语言,意味着在多语种混合的会议或访谈中,模型可以按语句粒度判断语种而非要求全程锁定单一语言。说话人分离让多人对话能被自动归属到不同发言者。词级时间戳为每个词提供精确的时间定位,便于做字幕对齐、片段检索与回溯定位。自定义词汇偏置支持最多1000个术语,把行业黑话、产品名、人名等模型可能陌生的词汇提前注入,显著改善专业场景的识别准确率。产品形态上分为两个端点:gemini-3.5-transcribe是非流式的语音转文本模型,用于处理已录制的音频文件;gemini-3.5-transcribe-live则是通过WebSocket走Live API的双向流式模型,支持中间态与最终态转写事件、智能转写模式以及多种语音活动检测策略,适用于实时字幕、会议记录、直播转写这类低延迟场景。需要说明的是,以上均为官方在API变更日志中描述的模型能力,并不代表每一种语言或每一种配置都能达到完全一致的质量水平。团队在切换生产流量之前,应针对自有音频素材实测延迟、说话人分离效果与词汇偏置的实际表现。
📋 技术规格
| 厂商 | Google DeepMind |
|---|---|
| 模型分类 | 语音与音频 |
| 参数规模 | 未公开 |
| 上下文窗口 | N/A(语音转文本模型,按音频时长计算) |
| 最大输出 | 未公开 |
| 知识截止 | 未公开 |
| API定价 | 输入: 未公开(按Gemini API语音处理计费,具体以官方价目表为准)输出: 未公开(按Gemini API语音处理计费,具体以官方价目表为准) |
⭐ 核心能力详解
覆盖超过85种语言的语句级语种检测
说话人分离与词级时间戳同时支持
最多1000个自定义词汇偏置术语
自动剔除口语语气词,输出规范书面文本
提供非流式与双向流式两个端点适配不同管线
通过Gemini API的Live API与Interactions API接入
🎯 典型应用场景
会议记录与纪要自动生成
播客与访谈内容转录
直播与视频的实时字幕生成
客服通话质检与内容分析
多语种国际会议的转写归档
医疗、法律等专业场景的口述记录
💪 技术优势与差异化
- 语句级语种检测适配多语种混合场景,无需全程锁定单一语言
- 自定义词汇偏置最多1000个术语,专业领域准确率可针对性优化
- 说话人分离与词级时间戳组合,输出可直接用于字幕与检索
- 自动剔除语气词,减少后处理工作量
- 流式与非流式双端点覆盖实时与批量两类需求
- 依托Gemini API生态,与Google其他模型链路衔接顺畅
⚠️ 使用局限与注意事项
- 参数规模与定价官方均未公开
- 官方明确说明并非每种语言与配置都能达到一致质量,需自行实测
- 闭源商业API,不支持私有化部署
- 自定义词汇偏置上限为1000个术语,超大术语表需分场景拆分
- 语音活动检测策略需按场景调参,默认配置未必适配所有音频
- 词级时间戳在重叠说话或强噪音场景的精度需实际验证
💰 价格分析与成本建议
Gemini 3.5 Transcribe的具体定价官方在发布信息中未公开明确数值,计费归入Gemini API的语音处理体系,实际成本需以Google官方价目表为准。做预算时有几个变量值得提前考虑:语音转写通常按音频时长而非token计费,因此成本与音频总量线性相关,批量归档类场景的量级容易被低估;流式端点因为需要持续保持连接并产出中间态事件,单位成本通常高于非流式的批量处理,能接受延迟的场景应优先走非流式端点;自定义词汇偏置属于配置项,一般不额外计费,但会影响识别质量进而减少人工校对成本。建议先用代表性音频样本跑一轮实测,同时统计识别准确率与人工校对工时,把模型成本与后处理人力成本合并核算,才能得到真实的单位转写成本。
👥 适用人群与企业
会议协作产品团队、媒体与播客制作方、字幕与本地化服务商、客服质检团队、多语种内容平台、需要语音输入能力的应用开发者
🏭 行业适配度评估
词级时间戳与自动去语气词直接适配字幕制作与内容归档管线
⚠ 强噪音与多人抢话片段仍需人工校对
多语种会议记录与说话人分离满足跨国团队的纪要需求
⚠ 涉密会议内容需评估数据出域合规性
课堂录音转写与多语种教学内容字幕生成
⚠ 未成年人语音数据处理需符合相应隐私法规
通话转写支撑质检与内容分析,自定义术语可注入产品名
⚠ 通话录音涉及个人信息,需完成用户告知与授权
口述病历与问诊记录转写可减少文书负担
⚠ 患者语音属敏感数据且不支持本地部署,多数医疗机构难以直接采用
庭审与咨询记录转写配合词级时间戳便于回溯
⚠ 涉密案件材料不宜通过公有云API处理
🔧 技术架构解析
| 端点设计 | gemini-3.5-transcribe为非流式语音转文本模型,处理已录制音频;gemini-3.5-transcribe-live为双向流式模型,通过WebSocket走Live API |
|---|---|
| 语种能力 | 语句级语种检测,覆盖超过85种语言,可在多语种混合音频中按语句粒度判断 |
| 结构化输出 | 支持说话人分离与词级时间戳,输出可直接用于字幕对齐、片段检索与发言归属 |
| 词汇定制 | 自定义词汇偏置支持最多1000个术语,用于注入行业术语、产品名与人名 |
| 流式特性 | live端点支持中间态与最终态转写事件,并提供多种语音活动检测策略供场景调优 |
| 接入方式 | 通过Gemini API的Live API(流式)与Interactions API(录制音频)接入 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(Google未在发布信息中明确说明转写音频是否用于模型训练) |
|---|---|
| 合规认证 | SOC 2、GDPR、ISO 27001 |
| 数据驻留 | 依托Google Cloud区域部署,数据处理位置以所选区域配置为准 |
| 加密方式 | 传输加密(TLS),存储加密由Google Cloud平台提供 |
⚔️ Gemini 3.5 Transcribe 与同类语音转写模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| Cohere Transcribe Arabic | 阿拉伯语场景做专项优化,垂直语种表现突出 | 语种覆盖面远窄于85种以上的通用方案 |
| 腾讯混元Hy ASR 3.0 Preview | 中文方言覆盖10大片区,中文WER表现优秀 | 多语种国际场景覆盖不及全球通用方案 |
| OpenAI GPT-Realtime-Whisper | OpenAI生态集成度高,实时管线成熟 | 自定义词汇偏置与说话人分离的配置粒度较粗 |
- 超过85种语言的语句级检测,多语种混合场景适配好
- 最多1000个自定义术语偏置,专业领域可针对性调优
- 说话人分离加词级时间戳,输出结构化程度高
- 流式与非流式双端点,一套模型覆盖实时与批量管线
🏢 同厂商模型矩阵
Google DeepMind 语音与多模态相关模型定位矩阵
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| Google DeepMind Gemini 3.5 Transcribe当前 | 专用语音转写 | audio | 85种以上语言,说话人分离与词级时间戳(当前模型) |
| Google DeepMind Gemini Omni 1.1 Flash | 视频生成与编辑 | video_gen | 场景延展至40秒,首尾帧插值,4K上采样 |
| Google DeepMind Gemini 3.7 Flash | 主力工作模型 | chat | 聚焦编程与Agent,100万上下文 |
| Gemini 3.5 Pro | 深度推理 | multimodal | 200万上下文,复杂推理与多模态 |
| Google DeepMind Gemini Omni Flash | 前代视频模型 | video | 首批Gemini Omni视频创作与对话式编辑模型 |
| Gemini 3.5 Flash-Lite | 低延迟高并发 | chat | 面向大批量低延迟任务 |
🧭 选型决策指南
语句级语种检测覆盖85种以上语言,无需全程锁定单一语言
说话人分离与词级时间戳同时支持,输出结构化程度高
自定义词汇偏置支持最多1000个术语
live端点通过WebSocket提供中间态与最终态事件
闭源商业API,不提供权重下载与私有化部署
垂直优化的专用ASR模型在单语种上可能表现更好
🏆 真实使用案例
📌 某跨国企业用Gemini 3.5 Transcribe做多语种会议归档
📌 某视频平台构建自动字幕管线
💬 用户真实评价
多语种会议里按语句切换语种这个能力很关键,以前锁定单语言的方案在中英混说的场景基本没法用。说话人分离也够准。
词级时间戳省掉了大量对轴工作,自动去语气词的输出干净得多。不过强噪音和多人抢话的片段还是要人工过一遍。
流式端点的中间态事件设计合理,接实时字幕很顺。可惜官方没公布明确定价,做成本模型时只能先按估算走。
✅ 实践建议与使用技巧
💡 Prompt工程建议
词汇偏置按场景分组
1000个术语上限有限,按业务场景拆分多套词表按需加载,比堆一张大表更有效。
为流式端点设置合适的静音阈值
语音活动检测策略决定断句时机,会议场景与直播场景的最优阈值差异明显。
先转写再交给文本模型加工
把转写与内容理解分成两步,转写用本模型、摘要与结论交给文本模型,链路更可控。
利用时间戳做定向复核
对置信度较低或术语密集的片段,用词级时间戳定位后做人工抽检,比全文复核高效。
🔄 替代方案分析
IBM随Granite 4.2发布了4.7亿参数的端侧语音识别模型,适合离线转写;混元ASR也有本地化选项可评估。
覆盖10大方言片区,中文WER表现优秀。
针对特定语种做专项优化,垂直准确率更高。
这些模型把语音理解与对话生成整合,无需单独串接转写环节。








首页 

2026-08-03


