Cohere Transcribe Arabic是Cohere于2026年7月7日发布的开源阿拉伯语语音转文本模型,基于Cohere Transcribe微调,使用阿拉伯语语音数据训练。模型在开源模型社区阿拉伯语ASR排行榜上以25.87 WER的成绩位居榜首,比Whisper Large V3低约11个点,人工评估者在约96%的对比测试中更偏好该模型。
模型采用2B参数的conformer-based encoder-decoder架构,支持所有主要阿拉伯语方言、阿拉伯口音英语以及阿拉伯语-英语双语混合语音。模型能处理方言变体、语码转换和阿拉伯语-英语双语语音,具有day-0 mlx-audio支持,优化了生产推理和吞吐量。
Cohere Transcribe Arabic通过V2 Audio Transcriptions API提供服务,同时作为开源权重在开源模型社区上发布。对于生产用途,支持Model Vault部署。模型采用Apache 2.0许可证,允许商业使用。
📋 技术规格
| 厂商 | Cohere |
|---|---|
| 模型分类 | 语音与音频 |
| 参数规模 | 2B |
| 上下文窗口 | N/A(语音输入) |
| 最大输出 | 文本转写结果 |
| 知识截止 | 2026-05 |
| API定价 | 输入: 免费(开源)/ API按量计费输出: 免费(开源) |
⭐ 核心能力详解
阿拉伯语ASR榜首
开源模型社区阿拉伯语ASR排行榜WER 25.87,比Whisper Large V3低11点
96%人工偏好
人工评估者在约96%的对比测试中更偏好该模型
全方言覆盖
支持所有主要阿拉伯语方言和阿拉伯口音英语
Apache 2.0开源
允许商业使用,支持开源模型社区下载和Model Vault部署
🎯 典型应用场景
阿拉伯语地区的语音转写服务
阿拉伯语客服系统的实时转写
阿拉伯语媒体内容的字幕生成
阿拉伯语-英语双语场景的语音处理
💪 技术优势与差异化
- WER 25.87,阿拉伯语ASR榜首
- 96%人工偏好,超越Whisper Large V3
- Apache 2.0开源,支持商业使用
- 全方言覆盖,适应阿拉伯语地区多样性
⚠️ 使用局限与注意事项
- 仅支持阿拉伯语和相关双语场景,非通用ASR模型
- 2B参数规模较大,端侧部署需量化优化
- 非阿拉伯语场景需使用其他Cohere Transcribe版本
- 生产级部署需Model Vault或API调用
💰 价格分析与成本建议
开源免费(Apache 2.0),API调用按Cohere标准定价。相比Whisper Large V3等闭源方案,开源策略让企业可以自部署降低成本。
👥 适用人群与企业
阿拉伯语地区的AI应用开发者、客服系统、媒体字幕团队
🔧 技术架构解析
| 架构设计 | 2B参数conformer-based encoder-decoder架构,基于Cohere Transcribe微调。 |
|---|---|
| 训练数据 | 使用阿拉伯语语音数据微调,覆盖所有主要方言。 |
| 推理优化 | 优化生产推理和吞吐量,支持day-0 mlx-audio。 |
| 部署方案 | 通过V2 Audio Transcriptions API或开源模型社区开源权重部署,生产用途支持Model Vault。 |
🏆 真实使用案例
📌 某中东电商用Transcribe Arabic做客服质检
💬 用户真实评价
Transcribe Arabic在方言场景的表现远超Whisper,我们的埃及方言和海湾方言客服通话都能准确转写。开源Apache 2.0让我们可以自部署,成本大幅降低。
🌐 行业落地洞察
Cohere Transcribe Arabic体现了AI模型向多语言、细分化发展的趋势。阿拉伯语作为全球使用人数众多的语言,专业ASR模型的缺失长期存在,Cohere的开源策略填补了这一空白。








首页 




