立即咨询

电话咨询

微信咨询

立即试用
商务合作

腾讯云容器服务Kubernetes(k8s)容器管理平台

腾讯云容器服务Kubernetes(k8s)容器管理平台,整合云原生容器管理系统与TKE集群托管管理系统功能。支持k8s集群全生命周期管理、容器化应用高效部署,助力企业简化云原生运维,提升集群稳定性与资源利用效率。
立即咨询

 

 

icon腾讯云容器产品全景图icon

 

 

iconTKE 托管集群icon
 
 
架构
Master 服务部署在 TKE Meta Cluster集群
Master 组件根据集群规模自动调整配置
Master 组件多可用区高可用部署
使用建议
日志告警已接入 TKE 支撑面,TKE 团队7*24 运维
TKE 可以帮助做大规模集群参数和配置调优

 

 

 

iconTKE Serverless 集群icon
 
架构
Master 组件托管在 Meta Cluster
Pod 运行在轻量级虚拟机里,具备良好隔离性
轻量级虚拟机和 CVM 共享大盘母机资源,资源量充足
使用建议
用户在 Pod 内看不到轻量级虚拟机,感知不到节点
TKE Serverless 集群有负载配额,大规模场景可联系架构师做配额调整

 

 

iconTKE 托管集群 vs TKE Serverless 集群icon

 

 

 

iconTKE 集群三种节点管理方式icon

 

 

iconTKE 集群三种节点管理方式——对比分析icon

 

 

iconTKE 集群三种节点管理方式——对比分析icon

 

 

iconTKE 集群节点最新演进icon

 

 

icon经典 Kubernetes 产品形态及问题icon
形态
先创Worker再创容器,需预准备多个Worker节点 业务容器混部在Worker节点上 Worker节点上预安装基础组件
问题
节点资源规划&运维问题
节点装箱率低,无法100%利用既有节点资源
先扩节点再扩Pod,扩缩容效率低
大规格节点供给困难,扩缩容困难 小规格节点管理复杂,海量节点易导致管理面问题
稳定性问题
Pod间共享内核、资源争抢带来稳定性问题
有容器逃逸等安全风险
系统组件升级困难,需先驱逐节点上的Pod
 
iconTKE Serverless 产品形态及优势icon
TKE Serverless 产品形态
100%使用资源,节点免运维
既有资源100%利用,小核心海量资源供给
极致的 Pod 弹性速度,轻松应对业务流量洪峰
无需感知和管理节点,免运维
极高的稳定性
Pod 间不共享内核
Pod 间无资源争抢
无容器逃逸风险,内核/系统组件随Pod运行自动升级
TKE Serverless 产品优势
精细化使用资源,利用率达100%,资源供给更充裕
内核隔离变为虚拟机级隔离,业务稳定性高

 

 

 

icon典型场景1:动态伸缩降低在线业务成本icon

 

 

icon案例分享:具有波峰波谷的在线业务(某电商客户)icon
"通用集群" 的问题及困境:
集群需要为波峰预留充足的资源,导致资源利用率偏低
Node 内个别 Pod 将网络 I/O 打到很高,导致节点出现异常
大促期间扩容 Node 节点需要 5-10 分钟,导致部分流量丢失
TKE Serverless 方案优势:
整体成本节约 30% 左右,运维负担也相应减轻
HPC + HPA 配置 "定时+自动" 扩缩容 Pod,轻松应对波峰波谷
POD 具有 "VM级别" 的强隔离性,客户无需关注节点稳定性等问题
平均 15-30秒 扩容一批 Pod,腾讯云大盘资源池,满足大促需求

 

 

icon典型场景2:对 TKE、IDC K8S、大数据集群的弹性扩容icon

TKE Serverless 支持在公有云或 IDC 的标准 Kubernetes 集群、Hadoop 集群部署插件,将扩容算力弹性调度到超级节点 Pod 资源池,调度模式完全兼容原集群调度方式,可让原集群平滑进行 Serverless化 或 混合云化 升级

 

 

 

icon案例分享:转码弹性扩容案例(某生活方式平台)icon
"通用集群" 的问题及困境:
晚上6~12点流量高峰转码算力不够
常驻节点业务低谷时资源闲置严重
TKE + 超级节点方案优势:
业务高峰时弹性扩容到超级节点
弹性扩容 pod 秒级计费,用完释放停止计费

 

 

 

 

 

 

icon典型场景3:TKE Serverless 便捷管理离线任务icon
人工处理阶段
不需要为集群增添资源
不用顾虑多任务间的资源竞争
自动化阶段
Pod 启动时实时申请资源
状态检查、健康检查完成后即自动开始执行
容器执行完成并退出 Pod 即自行终止
一旦终止即释放资源、停止计费

 

 

icon案例分享:大规模 CronJob 部署优化(某教育客户)icon
"通用集群" 的问题及困境:
频繁启停场景下,Cgroup 弱隔离带来节点稳定性问题
资源预留带来的资源利用率低的问题
TKE Serverless 方案优势:
节点稳定性大幅提升
无需预留资源,pod 按量计费,定时任务资源成本降低 70% 左右
秒级启动(超级节点镜像缓存,pod 启动加速)

 

 

 

 

 

 

 

iconTKE 原生节点——极致资源效能icon

原生节点:集成了全态混部技术的新类型节点

助力企业对云上云下、任意位置的服务器资源实现 7 * 24小时的极致利用

可交互式资源管控大盘—TKE Insight
一站式集成视图,智能分析浪费原因,提供优化建议、成本优化测算,可一键生成汇报报告
面向应用的优化:
提供极致内存压缩能力、解决内存瓶颈问题。应用启动时资源突发占用高的问题。智能request推荐、副本数推荐
面向调度的优化:
支持节点虚拟放大,基于真实水位的调度能力(调度时支持感知节点真实水位),  Numa 感知调度, 紧缩优先调度
面向内核的优化:
基于腾讯自研混部技术 TencentOS  RUE 内核,整合CPU、IO、网络、内存四大领域研发的混部特性,提供精细化分级QoS,支持对不同的业务设置明确资源使用限制,协助服务保障的精细化资源隔离,任务质量可保障
 
 
 
 

 

 

iconTKE 原生节点——极致资源效能icon

TKE Insight 效能洞察——多纬度、多角色、多场景成本洞察

提供成本洞察、稳定性洞察、安全洞察能力
成本洞察:容器级别的成本摊销和聚类,支持成本总量、利用率、单价加权排名。快速定位闲置、异常消耗资源
稳定性洞察:可观测调度行为,pod的异常波动、重调度行为带来的pod频繁驱逐、OOM等
安全洞察 :访问控制限制不同用户的访问权限,业务访问安全组配置,资源误删保护,数据加密保护隐私
为财务、业务、运维多个不同角色,提供多维度的洞察能力
财务/CFO:提供实时资源成本消耗视图,提供成本分析、观测能力
业务团队:监控容器内基本指标评估业务的性能效果,容器化部署的安全效果
运维团队:提供容器健康状态、oom等稳定性指标反映可靠性和可用性,提供利用率和装箱率多维指标反映资源效能
为集群、节点、应用不同云原生资源对象提供多纬度的洞察能力
集群:提供集群维度的成本观测视图、健康视图,全面暴露集群潜在风险
节点:Node Map 提供节点的资源利用率、装箱率情况,辅助用户分析节点可能存在的问题
应用:Workload map  支持所有类型的资源对象,该具备丰富的过滤查询、类型聚合、状态展示能力
 
 
 
 

 

 

iconTKE 原生节点——极致资源效能icon

面向应用的优化——让业务应用最小化资源需求

业务动态 burst能力
业务在主机空闲时使用更多的资源、加速启动运行
在资源紧张时能够严格限制住配置的资源上限,保障资源隔离
“悟净“内存动态回收和压缩
基于自研内核内存管理系统 LRU 页面回收机制
Cgroup 级内存压力与热度监控
业务压力自适应画像、页面换出自适应平衡
主动内存热度探测与分级、统一自适应后备设备平衡
Request 推荐、副本数推荐
基于历史用量的Request推荐
基于历史用量与未来预测的副本数推荐
 
 

 

 

iconTKE 原生节点——极致资源效能icon

面向调度的优化——让IT团队全方位提升资源效能

基于真实负载的动态调度、重调度、水位控制调度
基于 Node 的当前的真实以及历史负载情况,让集群的节点负载更加均衡
可以通过虚拟放大节点的可调度量,将节点装箱率提升到 100% 以上
支持调度时水位控制和运行时水位控制,在提升资源利用率的基础上保障稳定性
拓扑感知调度、紧缩调度
拓扑感知:Numa 感知性能优先调度、空闲资源更多的 Numa 感知调度等
紧缩调度:自定义打分score, 得分越高先分配,减少资源碎片
资源预留占位和模拟调度
在更新发布场景需调度器将资源“锁定”,防止其他Pod的抢占分配
保护现有资源或分配未来资源,帮助实现更可控的抢占、 Descheduling 和水平扩展流程
 
 
 

 

 

iconTKE 原生节点——极致资源效能icon

面向内核的优化——均衡成本效益与稳定可控和简单易用

原生节点混部内核确保高优业务稳定性
在线离线同时存在、在线始终优于离线
只存在离线、离线得到运行机会,在线唤醒抢占离线
默认集成全维度资源隔离与性能保障
CPU 超线程隔离、内存 QoS 增强、网络 QoS 增强、磁盘 IO QoS 增强
混部后离线业务对在线业务的干扰整体控制在5%,部分子系统能控制在1%
兼容性高:支持cgroup v1和v2
产品化提供可抢占式Job 和 SCF on TKE
可抢占式 Job:该类型 Job 使用的资源是集群中的闲置资源,不占用集群/节点真实的剩余可调度量,优先回收,保证正常使用 Request 资源的业务的稳定性
云函数SCF on TKE: 融合FaaS and K8S,云函数SCF 可运行在TKE空闲资源 

 

 

iconTKE 原生节点——极致资源效能icon

欢迎合作共建 Crane(Cloud Resource Analytics and Economics):

国内首个云原生成本优化开源项目,Augmented FinOps 赛道领导者

全球首个基于云原生的碳排放模型与应用碳排放计算器

开展 FinOps 布道
《降本之源-云原生成本管理白皮书》
《云成本优化节能减排白皮书》
FinOps “双降”讲坛
FinOps Community 公众号
FinOps 开源项目 Crane
制定 FinOps 标准
FinOps 国内首家顶级会员
信通院云管优秀案例
牵头《云原生 FinOps 能力成熟度模型》
参与《云成本优化工具技术要求》
参与《企业云成本优化能力与效果成熟度模型》
参与《云财务运营成熟度模型》
成立 FinOps 产业联盟
腾讯云牵头、40 家企业共同发起成立“FinOps 产业标准工作组”形成国内首个 FinOps 产业标准生态联盟,整合产、学、研、用各方力量,推动 FinOps 落地实践

 

 

iconTKE 原生节点——简化运维icon

原生节点:像管理Workload一样声明式管理Node节点

K8S运维常见问题
复杂的节点维护工作
繁琐的资源规划和调度工作
层出不穷的容器隔离性问题
节点组件
自安装软件、多种配置
基础组件:存储、负载均衡、监空等数十种
容器运行时:docker、containerd、安全沙箱等
K8s组件:kubelet、kubeproxy
OS:发行版、内核版本数百体组合
节点故障检测与自愈——响应时间降至分钟级别
系统实时检测需要人为干预解决的持续性故障
故障范围涵盖操作系统、k8s环境、运行时配置
通过预置专家经验(执行修复脚本、重启组件)来对故障进行快速响应
简化并辅助节点升级
简化节点k8s/运行时/操作系统版本的迭代和维护
结合腾讯前沿安全情报及时更新安全漏洞
支持设置时间窗口自定义运维周期
提供并行升级能力,降低节点升级时间

 

 

iconTKE 原生节点——辅助运维icon

原生节点:辅助运维,兼顾基础设施不可变和业务客制化

声明式基础设施管理

声明集群、节点故障自愈

声明节点池扩缩容策略

声明节点目标利用率

声明节点、k8s配置参数

 

 

iconTKE 原生节点——客户案例icon

XX找房作为“科技驱动的新居住服务商”,致力于推进居住服务产业数字化、智能化进程,为三亿中国家庭提供全方位的高品质、高效率居住服务

用户痛点
集群较多,整体资源利用率较低,85%以上的集群cpu利用率峰值低
平台方以保障业务稳定为主,不敢把集群装的太满,期望权衡稳定性和资源利用率
原生方案
使用 TKE原生节点 动态调度和重调度能力,提升集群装箱率及利用率
使用TKE原生节点水位控制,兼顾稳定性和资源效能

 

 

iconTKE 原生节点——客户案例icon

Java技术栈,数千核心, CPU(均值2%利用率),内存(均值80%利用率)

启动时CPU资源突发,运行时资源占用少;预分配内存、内存占用高

效果:资源总量减少45% 内存压缩至原60% 性能无干扰

 

 

iconTKE 原生节点——在离线混部和qGPUicon

 

 

icon负载原地升降配,业务0感知提升节点资源水位icon
 
场景一:满足降本诉求,提升节点资源利用率
为保障线上应用的稳定性,管理员通常会预留相当数量的资源Buffer来应对上下游链路的负载波动,容器的Request配置会远高于其实际的资源利用率,导致集群资源利用率过低,造成大量资源浪费
 
场景二:应对流量突发,保障业务稳定性
动态修改Pod资源参数功能适用于临时性的调整,例如当Pod内存使用率逐渐升高,为避免触发OOM(Out Of Memory)Killer,希望在不重启Pod的前提下提高内存的Limit。

 

 

iconTKE 超级节点 + 原生节点 最佳场景实践icon

 

 

iconjava 应用相关,利用原生节点降本增效的有效策略icon
 
通过 cpu burst 能力实现 java 应用快速启动突破 limits 限制,运行过程中偶发突破 limits 限制
 
通过合理配置 limits,实现更高的装箱率及资源利用率

 

iconjava 应用相关,利用原生节点降本增效的有效策略icon
 
 
 
本方案采集业务容器对于内存延迟的敏感性,自动调整容器要卸载到后备设备的内存量,后端根据待回收页面的访问频率换出到不同速度的后备设备中
 
 
需要腾讯云定制版内核支持

 

 

icon网络方案1:GlobalRouter 模式icon
 
 
控制面增强
控制面类似于社区
支持额外增强辅助容器网段
支持不同大小节点容器子网段
容器网段位于VPC之外
数据面增强
节点间 POD 数据包通过 VPC 直接路由效率高

 

 

icon网络方案2:弹性网卡模式icon
 
特点
从VPC分配子网做容器网段
弹性网卡绑定多个辅助IP供POD使用
IPAMD模块集中分配POD IP
策略路由控制节点上进出容器的流量
优势
StatefulSet 类型负载支持固定 IP
没有 bridge 转发提升网络性能
支持 LB 直通 POD
缺点
依赖弹性网卡
POD IP 的分配管理不在节点闭环,依赖独立的 ipamd 组件分配地址,相对复杂
 
 

 

 

icon网络方案3:独占弹性网卡模式icon
 
特点
流量直接进入 POD 网络空间,不要通过节点缺省命名空间中转,性能更优
不共用节点 conntrack,避免 POD 间干扰
缺点
依赖弹性网卡,有机型限制
相同规格的节点上,独占网卡模式支持的 Pod 会比共享网卡模式少
必须使用 TencentLinux

 

 

iconCLB Ingress Controllericon
优势
控制器监听 Ingress 直接修改操作 LB 绑定路由规则
网络流量从 LB 直接到业务 POD。
缺点
不支持正则表达式路由规则
不支持 rewrite 修改 url 路径
不支持金丝雀发布等高级特性
业务 Service 必须是 NodePort 类型(GR网络模式)

 

 

iconNginx Ingress Controllericon
 
 
复用 Nginx Ingress Controller 的所有特性
 
开箱即用,支持节点池 Daemonset 和 Deployment 两种部署方式
 
可以使用普通 ClusterIP 类型业务 Service
 

 

 

iconIstio Ingress Gatewayicon
 
 
丰富的流量管控能力,灰度发布
 
跨集群服务发现和路由
 
地域感知就近路由
 

 

 

iconLB 直通 Podicon
 
优势
不通过 nodeport 转发,性能高
一致的负载均衡视图,避免二次负载均衡造成负载不均
不经过 NodePort 没有 SNAT,避免源端口耗尽或者 conntrack 插入失败导致的丢包问题
 

 

 

iconVIP 客户服务icon
售前
技术交流,案例分享
协助梳理业务架构、容器化迁移方案
售中
协助解决迁移过程中遇到的各种问题
必要时提供驻场支持
售后
容器专项技术支持
丰富的问题未定及解决经验
7*24 小时服务

 

 

产品推荐

宁盾身份目录服务平台
宁盾身份目录服务平台,有线无线认证系统、VPN、堡垒机、网管平台等,Coremail邮箱、OA、ERP系统、网盘等,NDS目录服务支持ldap协议的应用对接,为各类应用提供账号管理,以及登录验证的能力。
免费试用
查看详情
晓多科技电器行业AI数智化解决方案
晓多科技电器行业AI数智化解决方案融合了人工智能、大数据分析和云计算技术,旨在帮助企业实现产品智能化、服务个性化和运营高效化。通过智能分析消费者行为,优化库存管理,提升客户服务体验,并利用物联网技术实现设备远程监控与维护,增强企业的市场竞争力和客户满意度。
免费试用
查看详情
云顶SCRM私域客户运营管理平台
云顶 SCRM 私域客户运营管理平台,是企微私域 SOP 运营核心系统。支持多渠道活码引流与客户自动打标签,构建完整用户画像,通过标准化 SOP 与智能群发实现精细化运营。集成客户资源保护、互动雷达追踪功能,防范客户流失,助力企业高效获客、提升转化与复购率。
免费试用
查看详情
世窗学生智能心理服务云平台
世窗学生智能心理服务云平台,整合学生心理健康测评系统与学校心理咨询辅导室建设方案。提供智能化心理测评、档案管理及咨询辅导功能,助力学校构建全流程心理服务体系,精准识别学生心理状态,提升心理健康教育效率,适配各级校园心理服务需求。
免费试用
查看详情