
业务挑战——高性能计算场景对网络要求苛刻
速度,一直都是高性能计算的核心,运算速度更快意味着一切繁复的运算和模拟会更快、更准确
高性能计算存在“木桶效应”,计算、存储、网络一旦出现瓶颈就会导致运算速度严重下降
VPC网络时延约40-60us,适用于存储数据拉取或在线请求首发。在多机并行计算场景相对乏力

什么是RDMA
RDMA(Remote Direct Memory Access),指节点间通信不需内核参与,所有payload的发送传输处理工作直接下沉到网卡上处理,减少数据拷贝和上下文切换开销;同时不需要消耗额外的CPU资源,完美满足高性能计算场景对于性能的追求

为什么云上需要弹性RDMA
传统TCP/IP捉襟见肘,RDMA已成为高性能网络的实际标准
万物上云时代,云上应用需要弹性RDMA获取技术红利
什么是vRDMA
弹性RDMA网卡
腾讯云vRDMA基于数据中心的VPC网络,提供用户一款云上专有,弹性插拔,业务应用可零成本适配的弹性RDMA网卡EFI(Elastic Fabric Interface), 体验高速网络RDMA的性能表现
vRDMA
高性能计算集群新产品矩阵
vRDMA产品形态
高性能计算集群(HCC)产品矩阵新增vRDMA机型,提供CPU和GPU不同机型产品
vRDMA和RDMA共同作为实例族-高性能计算集群(HCC)产品的网络底座支撑

应用场景
产品实例规格
AI训练场景
搭载最新代次AMD CPU ,最新自研弹性RDMA网络,整机搭配8卡GPU,适用于计算机视觉、语音识别等模型AI训练场景

HPC计算场景
第四代AMD EPYC处理器,最高3.7GHz频率,搭载100Gbps 弹性RDMA网络,提供物理核能力,适用计算流体动力学(CFD)等HPC计算应用

使用方式介绍
弹性RDMA能力需基于支持EFI的云服务器实例,创建挂载弹性RDMA网卡(EFI)即可使用

产品底层实现方案

vRDMA 功能支持及性能表现
VRDMA 支持绝大部分的RDMA功能,支持多种不同的模式以实现高速数据传输和处理

vRDMA VS RDMA,基础性能指标与硬件RDMA性能基本一致,无额外成本,性价比更高

vRDMA最佳实践

案例:HCC-VRDIA自研加速网络技术助力某头部出行客户训练集群上量落地
项目意义
腾讯云自研加速网络技术vRDIA赋能高性能计算集群HCC,为客户提供稳定的H20 GPU训练集群。在VPC网络基础上实现RDIA加速能力,无需增加额外硬件成本,为自动驾驶训练场景提供高性价比方案,i可快速复制L20等其他GPU机型支持vRDIA能力

EFI演进



