立即咨询

电话咨询

微信咨询

立即试用
商务合作

你要的AI大模型,都在这里

主流厂商全线接入,海量大模型任你选,用 AI 就这么简单

MiniMaxMiniMax

MiniMax-Speech-2.8-HD

以拟人化音质为定位,MiniMax-Speech-2.8-HD。MiniMax Speech 2.8 HD是MiniMax的高级语音合成模型,以高保真度和自然情感表达著称。

查看详情
腾讯混元腾讯混元

腾讯混元Hy ASR 3.0 Preview

Hy ASR 3.0 Preview是腾讯混元于2026年8月4日正式发布的新一代语音识别模型,标志着语音识别从单纯的声学特征映射进化到融合语义理解的全新阶段。该模型基于腾讯混元最新一代Hy3 MoE大语言模型构建,融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升。

查看详情
CohereCohere

Cohere Transcribe Arabic

Cohere于2026年7月7日开源阿拉伯语ASR模型Cohere Transcribe Arabic,2B参数conformer架构WER 25.87登顶榜首,覆盖所有主要方言和阿拉伯口音英语。

查看详情
通义千问通义千问

通义千问Qwen-Audio-3.0-Realtime-Flash

阿里云2026年7月15日发布的实时语音交互对话模型Flash版本,主打高速度和高性价比,毫秒级时延,VoiceBench口语化测试表现优异,适合高频调用场景。

查看详情
通义千问通义千问

通义千问Qwen-Audio-3.0-Realtime-Plus

阿里云2026年7月15日发布的实时语音交互对话模型Plus版本,毫秒级时延响应,支持工具调用、多轮对话、情感表达和实时交互,VoiceBench得分92.5,S2S语音指令遵循SOTA。

查看详情
OpenAIOpenAI

OpenAI GPT-Live-1 mini

OpenAI GPT-Live-1 mini是GPT-Live系列的轻量版本,面向免费用户开放,提供全双工实时语音交互和基础翻译能力,是入门级实时语音AI方案。

查看详情
OpenAIOpenAI

OpenAI GPT-Live-1

OpenAI GPT-Live-1是2026年7月8日发布的全双工实时语音模型,支持同步听说、实时翻译和自然打断,将人机语音交互延迟压缩至300毫秒以内,面向付费用户开放。

查看详情
OpenAIOpenAI

OpenAI GPT-Audio Mini

GPT-Audio Mini是OpenAI GPT-Audio系列的轻量版本,支持128K上下文窗口。与库中已有的GPT-Audio 1.5($2.50/$10)互补,Mini版定价约为标准版的24%,适合高并发的日常音频处理场景。

查看详情
通义千问通义千问

通义千问Fun-ASR

通义千问Fun-ASR是阿里云离线语音识别模型,适合录音文件转写、会议记录等非实时场景,与Fun-ASR-Realtime互补覆盖全场景语音识别需求。

查看详情
豆包大模型豆包大模型

豆包大模型Doubao-Seed-Audio 1.0

Doubao-Seed-Audio 1.0是字节跳动于2026年6月23日在火山引擎FORCE原动力大会上正式发布的豆包音频生成模型。该模型首次支持参考生成——把文本、音频任一模态作为输入,可以端到端生成目标音频,并在长时生成场景中保持多角色音色的一致性,大幅减少后期修音工作。

查看详情
通义千问通义千问

通义千问Qwen-Audio

Qwen-Audio支持语音识别和音频理解,可实现语音转文字和音频内容分析,为智能语音助手和多模态交互提供听觉能力。

查看详情
讯飞星火讯飞星火

讯飞星火星火语音大模型

星火语音大模型提供语音识别与合成一体能力,支持多语种和方言识别,在会议转写和智能语音交互中表现成熟。

查看详情
Mistral AIMistral AI

Mistral AI Voxtral

Voxtral是Mistral面向语音和音频处理的专用模型,支持语音识别和音频理解,为多模态AI系统增加听觉维度能力。

查看详情
Google DeepMindGoogle DeepMind

Lyria 3 Pro Preview

以拟人化音质为定位,Lyria 3 Pro Preview。Lyria 3 Pro是Google DeepMind的AI音乐生成模型,支持文本描述生成高质量音乐片段。

查看详情
通义千问通义千问

Fun-Music-V1

作为高准确率语音识别模型,Fun-Music-V1。Fun-Music V1是阿里云的AI音乐生成模型,支持文本描述或歌词生成原创音乐。在短视频配乐、游戏BGM和广告音乐场景中有广泛应用。。

查看详情
通义千问通义千问

Fun-ASR-Realtime

作为高准确率语音识别模型,Fun-ASR-Realtime。Fun-ASR-Realtime是阿里云的实时语音识别模型,支持流式输入和亚秒级延迟转写。在会议记录、直播字幕和语音助手场景中被广泛采用。。

查看详情
通义千问通义千问

CosyVoice-V3.5-Plus

以拟人化音质为定位,CosyVoice-V3.5-Plus。CosyVoice V3.5 Plus是阿里云的旗舰语音合成模型。

查看详情
Udio AIUdio AI

Udio-v2

为内容创作和有声产品提供专业级TTS,Udio-v2。Udio v2在音乐保真度和人声自然度上进一步提升。。

查看详情
Udio AIUdio AI

Udio-v1

为内容创作和有声产品提供专业级TTS,Udio-v1。Udio v1是Suno的主要竞争对手,以高保真音乐生成著称。。

查看详情
Suno AISuno AI

Suno-v3

凭借端到端建模和大规模标注数据,Suno-v3。Suno v3支持更多音乐风格,人声质量和歌词连贯性大幅提升。。

查看详情
Suno AISuno AI

Suno-v2

凭借先进的声学建模,Suno-v2是由suno推出的大规模语音与音频模型,支持超长上下文窗口。该模型在音乐生成、人声、歌词、高质量等核心能力上表现优异,

查看详情
Suno AISuno AI

Suno-v1

以高保真、低延迟为关键优势,Suno-v1。Suno v1是AI音乐生成的先驱,支持完整歌曲生成包括人声和歌词。。

查看详情
Stability AIStability AI

Stable-Audio-2

为内容创作和有声产品提供专业级TTS,Stable-Audio-2。Stable Audio 2是Stability AI的音频生成模型,支持文本描述生成音乐和音效。在AI音乐创作领域具有重要影响力。

查看详情
OpenAIOpenAI

Whisper-Large-v3-Turbo

凭借先进的声学建模,Whisper-Large-v3-Turbo。OpenAI Whisper Large v3 Turbo是Whisper的快速版本,延迟更低。。

查看详情