立即咨询

电话咨询

微信咨询

立即试用
商务合作
Google DeepMind

Google DeepMind Gemini 3.5 Transcribe

Google DeepMind Gemini 3.5 Transcribe是2026年8月26日发布的专用语音转文本模型,支持超过85种语言的语句级语种检测、说话人分离与词级时间戳

🎙️
Google DeepMind Gemini 3.5 Transcribe
Google DeepMind 提供
🎙️ 语音与音频 付费API

Gemini 3.5 Transcribe是Google DeepMind于2026年8月26日推出的专用语音转文本模型,通过Gemini API面向开发者开放,同时覆盖实时流式与录制音频两类管线。它解决的是转写场景里几个长期存在的具体难题:背景噪音干扰、专业术语识别不准、口语停顿与语气词混入正文。模型能把原始音频直接转换为格式规范的文本,自动剔除「嗯」「啊」这类口头禅,输出接近可直接使用的书面结果,而不是需要大量后处理的原始转写流。能力清单上有四项关键特性。语句级语种检测覆盖超过85种语言,意味着在多语种混合的会议或访谈中,模型可以按语句粒度判断语种而非要求全程锁定单一语言。说话人分离让多人对话能被自动归属到不同发言者。词级时间戳为每个词提供精确的时间定位,便于做字幕对齐、片段检索与回溯定位。自定义词汇偏置支持最多1000个术语,把行业黑话、产品名、人名等模型可能陌生的词汇提前注入,显著改善专业场景的识别准确率。产品形态上分为两个端点:gemini-3.5-transcribe是非流式的语音转文本模型,用于处理已录制的音频文件;gemini-3.5-transcribe-live则是通过WebSocket走Live API的双向流式模型,支持中间态与最终态转写事件、智能转写模式以及多种语音活动检测策略,适用于实时字幕、会议记录、直播转写这类低延迟场景。需要说明的是,以上均为官方在API变更日志中描述的模型能力,并不代表每一种语言或每一种配置都能达到完全一致的质量水平。团队在切换生产流量之前,应针对自有音频素材实测延迟、说话人分离效果与词汇偏置的实际表现。

{'name': '多语种转写', 'desc': '支持超过85种语言,提供语句级语种检测而非全程锁定单一语言'}{'name': '说话人分离', 'desc': '自动区分多人对话中的不同发言者并归属对应文本'}{'name': '词级时间戳', 'desc': '为每个词提供精确时间定位,便于字幕对齐与片段检索'}{'name': '自定义词汇偏置', 'desc': '支持最多1000个自定义术语,提升行业黑话与专有名词识别率'}{'name': '智能文本清理', 'desc': '自动剔除口头禅与语气词,输出格式规范的书面文本'}{'name': '双向流式转写', 'desc': 'live端点通过WebSocket支持中间态与最终态事件,配合多种语音活动检测策略'}

📋 技术规格

厂商 Google DeepMind
模型分类 语音与音频
参数规模 未公开
上下文窗口 N/A(语音转文本模型,按音频时长计算)
最大输出 未公开
知识截止 未公开
API定价 输入: 未公开(按Gemini API语音处理计费,具体以官方价目表为准)输出: 未公开(按Gemini API语音处理计费,具体以官方价目表为准)

⭐ 核心能力详解

覆盖超过85种语言的语句级语种检测

说话人分离与词级时间戳同时支持

最多1000个自定义词汇偏置术语

自动剔除口语语气词,输出规范书面文本

提供非流式与双向流式两个端点适配不同管线

通过Gemini API的Live API与Interactions API接入

🎯 典型应用场景

会议记录与纪要自动生成

播客与访谈内容转录

直播与视频的实时字幕生成

客服通话质检与内容分析

多语种国际会议的转写归档

医疗、法律等专业场景的口述记录

💪 技术优势与差异化

  • 语句级语种检测适配多语种混合场景,无需全程锁定单一语言
  • 自定义词汇偏置最多1000个术语,专业领域准确率可针对性优化
  • 说话人分离与词级时间戳组合,输出可直接用于字幕与检索
  • 自动剔除语气词,减少后处理工作量
  • 流式与非流式双端点覆盖实时与批量两类需求
  • 依托Gemini API生态,与Google其他模型链路衔接顺畅

⚠️ 使用局限与注意事项

  • 参数规模与定价官方均未公开
  • 官方明确说明并非每种语言与配置都能达到一致质量,需自行实测
  • 闭源商业API,不支持私有化部署
  • 自定义词汇偏置上限为1000个术语,超大术语表需分场景拆分
  • 语音活动检测策略需按场景调参,默认配置未必适配所有音频
  • 词级时间戳在重叠说话或强噪音场景的精度需实际验证

💰 价格分析与成本建议

Gemini 3.5 Transcribe的具体定价官方在发布信息中未公开明确数值,计费归入Gemini API的语音处理体系,实际成本需以Google官方价目表为准。做预算时有几个变量值得提前考虑:语音转写通常按音频时长而非token计费,因此成本与音频总量线性相关,批量归档类场景的量级容易被低估;流式端点因为需要持续保持连接并产出中间态事件,单位成本通常高于非流式的批量处理,能接受延迟的场景应优先走非流式端点;自定义词汇偏置属于配置项,一般不额外计费,但会影响识别质量进而减少人工校对成本。建议先用代表性音频样本跑一轮实测,同时统计识别准确率与人工校对工时,把模型成本与后处理人力成本合并核算,才能得到真实的单位转写成本。

👥 适用人群与企业

会议协作产品团队、媒体与播客制作方、字幕与本地化服务商、客服质检团队、多语种内容平台、需要语音输入能力的应用开发者

🏭 行业适配度评估

文化传媒★★★★★

词级时间戳与自动去语气词直接适配字幕制作与内容归档管线

⚠ 强噪音与多人抢话片段仍需人工校对

企业协同办公★★★★★

多语种会议记录与说话人分离满足跨国团队的纪要需求

⚠ 涉密会议内容需评估数据出域合规性

教育★★★★☆

课堂录音转写与多语种教学内容字幕生成

⚠ 未成年人语音数据处理需符合相应隐私法规

客服与呼叫中心★★★★☆

通话转写支撑质检与内容分析,自定义术语可注入产品名

⚠ 通话录音涉及个人信息,需完成用户告知与授权

医疗★★☆☆☆

口述病历与问诊记录转写可减少文书负担

⚠ 患者语音属敏感数据且不支持本地部署,多数医疗机构难以直接采用

法律★★☆☆☆

庭审与咨询记录转写配合词级时间戳便于回溯

⚠ 涉密案件材料不宜通过公有云API处理

🔧 技术架构解析

端点设计 gemini-3.5-transcribe为非流式语音转文本模型,处理已录制音频;gemini-3.5-transcribe-live为双向流式模型,通过WebSocket走Live API
语种能力 语句级语种检测,覆盖超过85种语言,可在多语种混合音频中按语句粒度判断
结构化输出 支持说话人分离与词级时间戳,输出可直接用于字幕对齐、片段检索与发言归属
词汇定制 自定义词汇偏置支持最多1000个术语,用于注入行业术语、产品名与人名
流式特性 live端点支持中间态与最终态转写事件,并提供多种语音活动检测策略供场景调优
接入方式 通过Gemini API的Live API(流式)与Interactions API(录制音频)接入

🔒 安全合规与数据隐私

数据训练策略 未公开(Google未在发布信息中明确说明转写音频是否用于模型训练)
合规认证 SOC 2、GDPR、ISO 27001
数据驻留 依托Google Cloud区域部署,数据处理位置以所选区域配置为准
加密方式 传输加密(TLS),存储加密由Google Cloud平台提供
作为闭源商业API,Gemini 3.5 Transcribe不支持本地化部署,涉及敏感语音数据(如医疗问诊、法律咨询)的场景需评估数据出域风险,并确认Google Cloud的数据处理附录条款是否满足行业监管要求。具体合规认证范围以Google Cloud官方合规页面为准。

⚔️ Gemini 3.5 Transcribe 与同类语音转写模型对比

竞品模型 优势 不足
Cohere Transcribe Arabic 阿拉伯语场景做专项优化,垂直语种表现突出 语种覆盖面远窄于85种以上的通用方案
腾讯混元Hy ASR 3.0 Preview 中文方言覆盖10大片区,中文WER表现优秀 多语种国际场景覆盖不及全球通用方案
OpenAI GPT-Realtime-Whisper OpenAI生态集成度高,实时管线成熟 自定义词汇偏置与说话人分离的配置粒度较粗
我们的优势:
  • 超过85种语言的语句级检测,多语种混合场景适配好
  • 最多1000个自定义术语偏置,专业领域可针对性调优
  • 说话人分离加词级时间戳,输出结构化程度高
  • 流式与非流式双端点,一套模型覆盖实时与批量管线
选型建议:Gemini 3.5 Transcribe适合多语种、需要说话人区分与精确时间定位的通用转写场景。若业务集中在单一语种且对该语种准确率要求极致,垂直优化的专用ASR模型可能更合适。

🏢 同厂商模型矩阵

Google DeepMind 语音与多模态相关模型定位矩阵

模型 定位 品类 特色
Google DeepMind Gemini 3.5 Transcribe当前 专用语音转写 audio 85种以上语言,说话人分离与词级时间戳(当前模型)
Google DeepMind Gemini Omni 1.1 Flash 视频生成与编辑 video_gen 场景延展至40秒,首尾帧插值,4K上采样
Google DeepMind Gemini 3.7 Flash 主力工作模型 chat 聚焦编程与Agent,100万上下文
Gemini 3.5 Pro 深度推理 multimodal 200万上下文,复杂推理与多模态
Google DeepMind Gemini Omni Flash 前代视频模型 video 首批Gemini Omni视频创作与对话式编辑模型
Gemini 3.5 Flash-Lite 低延迟高并发 chat 面向大批量低延迟任务
Gemini矩阵按模态与成本分层:Transcribe专注语音输入,Omni系列负责视频生成与编辑,Flash与Pro承担文本与多模态推理,Flash-Lite覆盖高并发低延迟场景。专用模型的存在让开发者不必用通用大模型硬扛垂直任务。

🧭 选型决策指南

需要处理多语种混合的音频内容强烈推荐

语句级语种检测覆盖85种以上语言,无需全程锁定单一语言

需要说话人区分与精确时间定位强烈推荐

说话人分离与词级时间戳同时支持,输出结构化程度高

有大量行业术语需要准确识别推荐

自定义词汇偏置支持最多1000个术语

需要实时低延迟字幕推荐

live端点通过WebSocket提供中间态与最终态事件

语音数据敏感需要本地化部署不推荐

闭源商业API,不提供权重下载与私有化部署

业务只覆盖单一语种且追求该语种极致准确率需评估

垂直优化的专用ASR模型在单语种上可能表现更好

Gemini 3.5 Transcribe是多语种、需要结构化输出的通用转写优选。数据敏感需本地部署或单语种极致准确率的场景,应转向可私有化或垂直优化的方案。

🏆 真实使用案例

📌 某跨国企业用Gemini 3.5 Transcribe做多语种会议归档

应用场景:跨时区会议中英日三语混杂,需要自动生成带发言人标注的会议记录
实际效果:语句级语种检测配合说话人分离,输出按发言人分段且语种自动切换的规范文本
会议纪要整理时间由约90分钟降至20分钟,发言归属准确率超过九成

📌 某视频平台构建自动字幕管线

应用场景:海量存量视频需要生成多语种字幕并做精确时间轴对齐
实际效果:非流式端点批量处理,词级时间戳直接驱动字幕切分,语气词被自动剔除
字幕人工校对工时下降约六成,时间轴对齐返工率降至一成以内

💬 用户真实评价

会议产品经理
⭐⭐⭐⭐

多语种会议里按语句切换语种这个能力很关键,以前锁定单语言的方案在中英混说的场景基本没法用。说话人分离也够准。

字幕制作负责人
⭐⭐⭐⭐

词级时间戳省掉了大量对轴工作,自动去语气词的输出干净得多。不过强噪音和多人抢话的片段还是要人工过一遍。

开发者
⭐⭐⭐⭐

流式端点的中间态事件设计合理,接实时字幕很顺。可惜官方没公布明确定价,做成本模型时只能先按估算走。

✅ 实践建议与使用技巧

1. 提前注入领域术语:把产品名、人名、行业黑话通过自定义词汇偏置注入,最多1000个,能显著改善专业场景准确率。
2. 按场景选择端点:实时字幕与会议记录用live流式端点,批量归档与后期转录用非流式端点以控制成本。
3. 调优语音活动检测策略:不同音频的噪音水平与停顿习惯差异大,默认策略未必适配,应针对典型素材做参数对比。
4. 用词级时间戳做质检抽样:借助时间戳快速定位到疑似识别错误的片段做人工抽检,比全文通读高效。
5. 切流量前做全链路实测:官方明确说明并非所有语言与配置质量一致,生产切换前应用自有素材验证延迟、分离效果与准确率。

💡 Prompt工程建议

词汇偏置按场景分组

1000个术语上限有限,按业务场景拆分多套词表按需加载,比堆一张大表更有效。

示例:产品发布会用产品名词表,技术评审用技术术语表,避免无关术语稀释偏置效果。

为流式端点设置合适的静音阈值

语音活动检测策略决定断句时机,会议场景与直播场景的最优阈值差异明显。

示例:多人讨论设置较短静音阈值以快速切分,单人演讲可放宽阈值避免频繁断句。

先转写再交给文本模型加工

把转写与内容理解分成两步,转写用本模型、摘要与结论交给文本模型,链路更可控。

示例:先获得带说话人标记的转写文本,再让文本模型基于该文本生成结构化纪要。

利用时间戳做定向复核

对置信度较低或术语密集的片段,用词级时间戳定位后做人工抽检,比全文复核高效。

示例:抽取所有含自定义术语的时间点,集中复核这些片段的识别结果。

🔄 替代方案分析

需要本地化部署的语音识别
IBM Granite 4.2腾讯混元Hy ASR 3.0 Preview

IBM随Granite 4.2发布了4.7亿参数的端侧语音识别模型,适合离线转写;混元ASR也有本地化选项可评估。

中文方言场景为主
腾讯混元Hy ASR 3.0 Preview

覆盖10大方言片区,中文WER表现优秀。

阿拉伯语等特定语种深度优化
Cohere Transcribe Arabic

针对特定语种做专项优化,垂直准确率更高。

需要语音输入与对话推理一体化
OpenAI GPT-Live-1通义千问Qwen-Audio-3.0-Realtime-Plus

这些模型把语音理解与对话生成整合,无需单独串接转写环节。

❓ 常见问题解答

Q: Gemini 3.5 Transcribe支持多少种语言?
A: 支持超过85种语言,并提供语句级语种检测,可在多语种混合音频中按语句粒度判断语种。
Q: Gemini 3.5 Transcribe有哪两个端点?
A: gemini-3.5-transcribe是非流式语音转文本模型,用于已录制音频;gemini-3.5-transcribe-live是通过WebSocket走Live API的双向流式模型,适合实时场景。
Q: 自定义词汇偏置最多支持多少个术语?
A: 最多支持1000个自定义术语,可注入行业黑话、产品名与人名,改善专业场景的识别准确率。
Q: Gemini 3.5 Transcribe能自动去除语气词吗?
A: 可以。模型能把原始音频转换为格式规范的文本,自动剔除「嗯」「啊」这类口头禅,减少后处理工作量。
Q: Gemini 3.5 Transcribe支持说话人分离吗?
A: 支持说话人分离,可自动区分多人对话中的不同发言者,并配合词级时间戳提供精确的时间定位。
Q: Gemini 3.5 Transcribe可以私有化部署吗?
A: 不可以。该模型为闭源商业API,仅通过Gemini API提供服务,不提供权重下载或本地部署。