
Why GPU:单一架构算力难以满足智能时代需求

GPU主流应用场景

百度智能云laas产品矩阵

GPU云服务器产品架构
GPU云服务器:配备GPU的云端服务器,可以为机器学习、高性能计算、图形图像渲染等计算密集型应用提供加速处理能力。
根据需求场景的不同,既可提供虚拟机形态,也可提供裸金属形态。

GPU云服务器实例命名规则
GPU云服务实例命名由4部分组成,其格式为:产品代号+实例规格族+基本规格信息+扩展规格信息。
产品代号:如bcc,代表该实例规格所属产品系列。
实例规格族:如gn5,代表该实例规格包含的资源类型,
基本规格信息:如c128m1024g,代表该实例规格中包含的vCPU数量(单位:个)及内存大小(单位:GiB)
扩展规格信息:如4a10,代表该实例规格所包含的扩展硬件资源配置,比如GPU卡数量,RDMA网口数量,实例本地盘数量等。

GPU云服务 关键功能特性

云上机密计算环境
BCC支持用户创建机密虚拟机,构建支持TDX和CC特性的CPU&GPU机密计算环境,实现基于硬件的云服务器机密保护,达到无论是云厂商还是外部攻击者均无法监控或者篡改机密虚拟机的运行状态和数据。

增效,利用部署集优化实例的高可用或通信性能
部署集是控制实例分布的策略,使您能在创建实例的时候就设计实例如何在物理设备分布。

百度智能云公共镜像列表

即开即用的GPU运行环境


弹性RDMA网卡加速分布式计算
弾性RDMA网卡(ERI)是一种能支持云服务器实例间在私有网络以 RDMA 通信的弹性网卡类型,具有低时延、高吞吐、低负载的特点,能显著提升云服务之间的通信效率。同时,ERI支持弹性网卡的产品特性,可实现高可用网络方案。

弹性RDMA网卡提高通信性

ERI 对比 EHC 专有 RDMA 网卡

维修平台优化GPU硬件故障处理效率

便携运维,丰富的GPU监控指标
云监控BcM(Baidu cloud Monitor)可以帮助您监控在百度云上使用的各类云产品的健康状态,包括GPU云服务器、云数据库、对象存储、内容分发网络等。针对GPU实例,BCM提供了多种、多维度的指标监控。

便携运维,自助诊断工具,您的专属实例医生
自助诊断工具是百度智能云云服务器产品提供的辅助工具,触发式使用,用于快速诊断云服务器实例的亚健康状态及优化应用性能,增加强业务效率。

AIAK 工具加速 AI 场景主流模型

sGPU虚拟化工具提高资源利用率
百度智能云自研的sGPU容器共享技术,支持用户通过容器,按需分配业务所需要的GPU算力和显存资源,以更细颗粒度调度使用GPU,从而提高GPU资源利用率。

降本,sGPU评测数据-容器间算力隔离且性能无损

汽车行业,GPU云服务器助理理想汽车加速智能汽车研发
全栈式 乘用车 自动驾驶云平台。

直播行业,YY基于百度 构建训推一体
客户收益:
云原生AI:GPU deviceplugin实现多 Pod 共享单张GPU 卡时进行显存和算力级别的隔离解决 AI 训练等场景中独占整张卡造成资源浪费的情况,提升了整体GPU资源的利用率,降低成本30%。
沧海存储:BOS解决AI数据的中传传输以及训练后数据的归档问题,与PFS天然联动解决冷热数据的分离,PFS主要解决大规模训练下数据集的元数据扩容问题以及并发性能问题,数据读取效率提升20%左右。

教育行业,百度智能云助力用户0到1业务上线



