立即咨询

电话咨询

微信咨询

立即试用
商务合作

云知声语音技术服务

云知声语音技术服务,整合ASR语音识别API/SDK与TTS语音合成API/SDK功能。支持多场景语音精准识别、自然语音合成及实时语音交互处理,助力企业快速集成语音能力,提升产品智能化交互体验与开发效率。
立即咨询

 

icon云知声的AGI架构——以大模型为基础的全栈AI技术和产业化能力icon

云知声是亚洲通用人工智能(AGI)技术产业化领导者,也是全球首批实现大模型商业化的人工智能企业按收入计,公司是中国前三的AI解决方案提供商,在中国智慧物联及智慧交通、智慧医疗行业均排名第三

 

 

 

iconAtas其础设——持续为公司技术与产品提供顶级研发动能支持icon
算力
世界一流的超算平台
突破硬件资源及调度制约
算法/模型
通过自研算法研发量产并模块化封装模型,降低研发及实施成本,并以多种模式交付满足不同需求
大数据
独立第三方语音云平台积累海量真实场景数据
已实现全栈 AI 技术覆盖,一站式满足客户智能化升级需求:
信号感知、语音识别、语音合成、语义理解、图像识别、机器翻译、声纹识别...

 

 

 

iconAIOT智能物联技术——以人工智能技术赋能万物互联应用场景构建icon

结合人工智能、数字模型、传感器、实时数据等技术的综合应用,通过在虚拟世界中创建物理实体的数字孪生体,实现物理世界与虚拟世界的深度交互与万物互联,进而优化物理世界的运行效率和决策过程

 

 

 

icon山海大模型——逐云破浪 奔赴山海icon

C-Eva:由清华大学、上海交通大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集,包含13948道多项选择题,涵盖数学、物理、化学、生物、历史。政治、计算机等52个不同学科和四个难度级别,是全球最具影响力的综合性考试评测集之一

 

 

 

icon山海大模型——通用能力世界一流,专业能力世界第一icon

“山海”之力:七项通用能力

语言生成
以云知声黄伟的身份,写一份给各位领导、客户、合作伙伴来参加山海大模型成果发布会的感谢函
知识问答
八大山人是八个人吗?
数学能力
今有鸡兔同笼,上有35头,下有94足,请问鸡免各有多少只?
安全合规能力(人类对齐)
课后作业太多了,我不想上学了。山海会劝导积极向上,避免消极思想
语言理解
请问这句话里的一个行是什么意思?行的人,干一行行一行,行行都行
推理能力
判断下面的逻辑推论是否正确,所有的猫都爱吃鱼,所以爱吃鱼的动物都是猫
代码能力
楼梯有n阶,上楼可以一步上一阶,也可以一步上两阶,编一个Python程序计算,有多少种走法

 

 

 

icon多模态识别——以语音技术为核心构建多模态识别全栈技术链条icon
语音识别ASR
 
一句话识别
语音搜索
语音控制
语音输入
实时语音转写
演讲 & 大会 & 直播
字幕同屏
实时会议记录
实时客服记录
音频文件转写
会议 & 访谈转写
字幕生成
音频内容分析
声纹识别
声纹识别 1:1
鷯掉吶纹识别 1:N
说话人分离
性别年龄识别
图像识别
OCR
物体识别
指读识别
人脸识别
唇动识别
自然语言处理
文本分类
短文本语义相似度
命名实体识别

 

 

 

icon山海大模型——通用能力世界一流,专业能力世界第一icon
通用能力世界一流排
山海通用大模型优于ChatGPT,290% GPT4,处于国内大模型第一梯队
山海在AliqnBench上得分为6.55分,根据公开榜单这是国内最接近GPT4水平的大模型:其中中文理解能力已经超过GPT-4,中文语言、文本写作、综合问答和专业能力都在GPT-4水平的90%以上
专业能力世界第一排
多个行业或场景大模型(医疗、轨交、车机交互、KMS)能力超过GPT-4
其中医疗专业能力在MedQA任务上超过了GoogleMedPaLM2,达到了87.1%的优异成绩,全球第一。此外,在临床执业医师资格考试中,山海大模型的分数提升到了523分(满分600分),这一成绩超越了99%的考生水平

 

 

icon应用案例icon
智慧医疗:基于山海大模型的门诊病历生成系统示范应用
在智慧医疗领域,基于云知声700亿参数规模的自研“山海”大模型,结合前端声音信号处理、声纹识别、语音识别、语音合成等全栈式智能语音交互技术,联合研发门诊医患对话场景下的电子病历自动生成系统,实现诊室复杂环境下的降、医患角色区分、信息摘要及病历自动生成等功能,预计可提升医生的电子病历录入效率超过400%,节约单个患者问诊时间超过40%,提升医生门诊效率超过66%

 

 

 

icon山海大模型能力之——智能车载icon

结合大模型持续优化用户体验,为车主打造未来第三空间,成为最贴心的伙伴、朋友

重塑交互体验
升级驾驶座舱人机交互体验
口语化交耳,随心说
LLM与极氪云+端深度融合,形成智慧大脑
赋予行业知识
陪伴生活工作的专家伙伴
心理伙伴,陪伴车主与家人
个人助理,给到车主专属的支持和建议
护航用车安全
主使用安全的持续运营
车辆使用问题,直接提问,无需翻看手册
仪表盘图标闪烁,全然知晓

 

 

 

icon车载全景图基础底层——KMS——行业专家/大模型——人设包icon

针对企业行业知识高精度、数据安全的要求,可基于KMS(Knowledge ManagementSystem)技术能力,通过特定数据强化训练,达到行业专家级溯源对话,为用户提供专业建议

 

 

 

icon山海大模型能力之——智能轨交icon

央视《焦点访谈》聚焦国内人工智能产业开展专题报道,由云知声山海大模型赋能升级的南宁火车东站“出镜”节目,充分彰显其大模型场景落地实力

 
查询公共设施位置展示到屏幕上
并语音提示“已为您查询到公共设施位置
 
线路规划,展示从当前位置前往目的地的路线
标准问答类
换乘导航
地铁换乘帮助用户在地铁网络中获取最佳换乘路线的功能。该功能可以在三端服务中找到
开放问答类
智能客服
基于数字人智慧问询屏,通过数字虚拟人的形象可以为客户提供地铁乘换及其他开放式的问题。同时可进行自助购票、站内导航等业务操作
辅助功能类
故障报修
当设备存在故障,设备可自动与人工的提交故障报修工单,检修人员通过终端接收信息,并执行检修工单任务

 

 

 

icon多模态技术icon

云知声从交互入手,构建了语音感知、认知和表达、超算平台与图像、机器翻译等多模态人工智能硬核技术,并将这些能力封装在自研 AI芯片之上,通过“云芯一体化”产品体系面向行业推出全栈式 AI 技术能力,打造从 AI技术创新到产业应用的生态闭环

 

 

 

icon语音识别——产品功能icon
语音识别
语音识别(ASR:Automatic Speech Recognition),也称语音转写/语音转文字,是将语音信号转换为文字符号的技术
一句话识别
将短音频(≤60秒)精准识别成文字,实时返回识别结果,达到边说边显示文字的效果,适用于语音搜索、语音交互场景
实时长语音识别
对长时间持续输入的语音流进行识别,达到“边说边出文字”的效果,内容智能断句,适用于视频直播,会议研究、智能语音助手等场景
非实时短语音识别
 将短音频(≤60秒)精准识别成文字,异步返回识别结果,适用于社交应用、语音指令场景
非实时长语音识别
将长段音频文件(5小时以内或文件大小在2G以下)转换成文本数据,商业用户可在6小时之内获得识别文本。适用于会议转写、字幕生成、音频内容分析等场景
自学习平台
基于云知声语音识别技术,可自行上传热词或语言文本数据集,对模型进行深度定制。提升垂直领域的语音识别准确率

 

 

icon语音识别——技术特点icon
高识别率
基于先进的深度学习算法,安静环境下近场语音识别,中文普通话字准确率超过98%
快速响应
流式接口,实时传输,响应速度可达毫秒级,用户边说边返回文字
格式转换、智能标点
支持对数字、日期、时间等返回格式化文本,根据对话语境,智能断句并匹配标点
专属定制
根据应用场景需要,支持热词、个性化模型和语音声学模型等不同层面的定制

 

 

icon语音识别——产品性能icon
低延时响应
实时语音场景下的尾包延迟控制在200ms以内
尾包延迟是指:从语音信号结束到识别结果输出的时间延迟,较低的尾包延迟可以提供更快的识别响应速度和更好的用户体验
实时率
在非实时语音识别场景下的语音实时率在0.3以下
实时率是指:语音输入到输出结果所需的时间,实时率的值越小,说明语音识别系统的解码速度越快,实时性越好。计算方式为识别完成所需要的时间/音频时长
单核转写比
在非实时语音识别场景下单核转写比不低于4:1
单核转写比是指:通过单核处理器进行语音转写任务时,所需的时间与输入语音的长度之间的比值。这个比值可以衡量语音识别系统的转写速度和效率。计算方式为音频时长/识别耗时/核数
服务稳定
面向私部署场景下提供了不同类型的高可用部署方案,既支持少量服务器的轻量级多机高可用,也支持实现弹性扩容的大规模容器集群的部署

 

icon案例一icon

 

 

 

 

icon案例二icon

提供ASR私有化服务,工人使用手机在生产车间进行巡检,巡检需要记录的内容通过语音进行转写,该场景下需要重点解决降噪问题

 

 

 

icon多模态识别——语音识别能力全球领先icon

特性                                                                                                                                          优势

支持多种语言,可达銹墴卫商呎莠茹联级别高准确率
支持普通话,英语,粤语,四川话语音识别
普通话平均识别准确率达98%
英语平均识别准确率达95%
粤语平均识别准确率达93%
四川话平均识别准确率达94%
角色分离
在多人对话场景下可以在转写时对说话人角色识别,输出相应识别结果
语法、热词定制
云知声热词和定制语法能力可即时生效,用户从界面上输入要优化的文本,或专业性名词,可定点提升词汇和句式的识别准确率
专业领域识别
结合实际真实场景音频,通过声学模型和语言模型的深度配合,专业领域识别准确率可大幅提升。语言模型上除了学习大量的专业词汇,还对专业词条的上下文句式搭配进行学习
医疗领域识别准确率可达95%
车载领域识别准确率可达95%
家居领域识别准确率可达97%
童声识别
通过数干小时不同地域儿童语音训练,超算机器学习持续优化,解决了儿童语音识别难的问题,目前识别准确率可达96%
识别速度快
实时进行语音数据的传输和云端的识别,相应时间可达毫秒级,并同步展示中间文字结果,快速识别音频流

 

 

icon语音识别——应用场景icon
智能客服质检
将客服通话录音识别为文字,通过质检规则对文本进行分析,及时发现违规内容并干预处理
大屏语音助手
语音输入,解放双手,适用于语音控制、搜索等多种场景
会议访谈实时记录
将会议、访谈音频识别为文字,自动切分语音,降本增效;同时自动分段,有效提升会议内容记录效率
演讲内容实时上屏
借助先进的语音识别技术,演讲内容能够实时、准确地呈现在屏幕上,提升演讲的专业性和效果
字幕实时显示
将视频中的音频进行语音识别并标记时间戳,生成对应字幕,提升配置字幕效率
游戏语音输入
针对游戏语音输入,支持用户“边说边出文字”的效果,极大降低用户文字沟通费力度、提升沟通效率

 

 

iconTTS技术icon

定制方案及案例

除标准音库外,还可支持用户个性化声音复刻仅需10分钟数据,合成语音自然度、以及合成语音和原始语音的相似度 MOS 均可达到 4.0

 

 

 

 

icon语音合成——产品功能icon

语音合成
语音合成(TTS:Text to Speech), 通过深度学习技术,将输入的文字转换为音频,提供高音质、个性化的音频,效果接近真人,满足不同场景需求

短文本合成
将短文本(≤500 字符)转换成自然流畅的语音,支持多种音色,并提供调节音量、语速、音高、亮度等功能。适用导航于智能客服、语音交互、播报等场景
长文本合成
将长文本(≤5 万字符)转换成自然流畅的语音,提供更多音色、不同情感的发音人,适用于文学阅读、新闻播报、自媒体配音等场景。合成音可供下载使用
音库定制
面向企业客户,由专业团队提供定制音库服务,通过深度学习技术建模,生成逼真的专属IP发音人,适用于智能接待、智能硬件、有声阅读、新闻播报等有声场景
声音克隆
赋能APP和智能硬件,录制少量的用户声音,短时间内训练得到音色和发音风格与录音非常相似的声音模型,进而使用该声音模型完成讲故事、播天气、读小说、导航播报等功能

 

 

icon语音合成——技术特点icon
领先的技术方案
基于GAN和Transformer机制的高音质语音合成,综合利用声学和语言学参数,达到更自然的韵律合成效果
多领域覆盖
覆盖客服、车载、智能家居、音箱、导航、教育、金融、保险等不同场景,专业领域的知识,让发音更准确
自然流畅的听感
使用海量的音频合成数据训练,生成更真实饱满音质、抑扬顿挫、富有表现力,MOS评分达到业内领先水准
海量音色选择
超过100+商业化音色,涵盖男生、女生、童声,支持中文、英文、日语、韩语、巴葡、西班牙语、粤语、台湾话、天津话、四川话、东北话、维语等外语和方言

 

 

icon语音合成——产品体验icon

功能
支持多种情感/风格  支持5档情感强弱的调节

 

 

icon语音合成——产品体验icon
功能介绍
支持音子级别时间戳,主要用于驱动虚拟人口型,支持字级别时间戳,主要用于视频配音字幕,有声书朗读等
优势
1、颗粒度细:支持字级别,对齐准确
2、数字、英文、特殊符号等,也能直接对齐到原始文本,而不是TN转换后的结果,可以直接使用

 

 

 

icon语音合成——试用体验icon

声音复刻体验
打开微信扫一扫——打开”云知声智能语音体验馆”进行声音复刻体验。定制您的专属语音包

 

 

 

iconAI引擎核心能力指标icon

通用领域识别率可达98%;语音合成实时率可达0.081;3-5m远讲识别率超过94.2%;支持千万级海量并发

 

 

 

icon云知声AI感知技术icon

 

 

 

icon云知声AI生成技术icon

 

 

 

icon公司简介icon

连续6年云知声自2018年起,入围“CB lnsights 全球人工智能独角兽榜单”
全球人工智能独角兽共90家其中中国15家
云知声是榜单中唯一的一家国内语音人工智能独角兽

 

 

 

产品推荐

苏宁科技零售经营分析解决方案
苏宁科技零售经营分析解决方案,数据高效集成,内置全链路分析资产,产品开箱即用。能力成熟,经过苏宁易购数十年实践验证。积累行业数据化运营深度认知,零售经营链路数据全覆盖。
免费试用
查看详情
Rokid AR Studio空间计算平台
Rokid AR Studio 空间计算平台专注提供软 AR 智能眼镜推荐与AR 数字展厅方案的全栈式解决方案。依托 AI 驱动的空间计算技术,支持 3D 建模、虚实融合渲染及多模态交互,助力企业快速构建沉浸式数字展厅、虚拟导购等场景
免费试用
查看详情
智路科技AI数字人
智路科技 AI 数字人,专业虚拟数字人形象定制与 AI 直播系统服务。核心产品涵盖智路 AI 数字人克隆系统、无人直播系统、智播手机及超级 AI 智能体工作流,适配形象定制、智能直播等场景。依托全链条 AI 技术,助力企业快速部署数字人应用,是 AI 数字人领域功能全面的优选方案。
免费试用
查看详情
腾讯云聚合支付解决方案
腾讯云聚合支付解决方案,通过技术手段将银行和第三方支付机构的多种支付服务整合于一体的支付方式。包含证件 OCR 识别、活体检测、人脸1:1对比等能力,以解决行业内大量对用户身份信息核验的需求。E证通基于腾讯云人脸核身技术,为网络身份信息 EID 提供权威、统一、合规的身份信息核验服务的小程序服务。
免费试用
查看详情