立即咨询

电话咨询

微信咨询

立即试用
商务合作

腾讯云TI平台

腾讯云TI平台,作为人工智能开发服务平台与AI大模型推理训练平台,为企业及开发者提供全流程AI开发支持。覆盖模型训练、推理部署等核心环节,简化AI开发流程,助力高效构建AI应用,适配多场景需求,推动业务智能化升级。
立即咨询
icon业务挑战:模型构建与应用仍存在诸多挑战icon
模型欠缺行业知识
通用领域大模型百花齐放,但都不具备特定行业的独有知识和任务处理能力,欠缺行业属性导致无法落地实际业务
数据准备投入大
算法人员要投入超过60%时间进行高质量数据准备,针对大批量数据,进行数据清洗,标注,特征工程,等一系列预处理
大规模训练不稳定
大规模模型训练需耗费大量GPU 资源且训练周期长,对训练平台的稳定性、故障隔离性、自动容错性等底座能力,以及任务长时间成功运行考验极大
资源调度管理难
采购的算力资源有限,使用诉求远超可用算力,需要高效的算力资源调度管理系统,灵活分配算力使用,减少节点资源碎片,提高资源使用率

 

 

iconTI-ONE核心能力:提供包含辨别式AI和生成式AI的一站式AI开发解决方案icon

 

 

icon腾讯云TI平台TI-ONE公有云 – 产品架构icon

 

 

icon运营支持维度icon
提升效果
用户基于 ti的算法和模型,数据获得用户光靠自己或者开源方案,无法提升的业务效果。比如TI OCR算法,人脸算法等
降低风险
用户需要付出额外的专业能力应对安全风险的。比如:大模型的合规备案。比如:图像的内容审核
提升人效
用户客户通过加人力来实现的,但是用户需要付出额外的人力和时间成本。比如 有的客户基于tke +开源的kubeflow 自己搭建训练集群。比如 客户基于taco或者开源的deepspeed 可以实现的加速能力
降低成本
主要是用于降低客户的运营(也就是机器基础设施的成本)。比如:提供用户性价比更高的机器,如使用4090替换A100。比如: 用tiacc的加速算法帮客户加速,减少客户机器的使用

 

 

icon大模型精调icon
产品方案
方案说明: 在大语言模型精调场景中,面向算法开发工程师,提供涵盖数据管理、模型训练、评估测试、服务部署全流程的一站式服务。提供开箱即用的精调工具链,让算法人员专注于模型效果提升,提升精调效率。优势点: 可实战的数据构建能力:针对大模型精调提供3类全开源,可扩展的数据构建pipeline,同时提供30+数据过滤,改写方法 灵活的多模态标注:灵活配置自动解析数据schema,自动生成多种大模型标注场景 稳定的任务调度:故障节点自动隔离,任务自动重试,支持单任务2~3个月持续运行 调度策略:提升小资源任务的并发处理能力,降低碎片化
泛互的典型应用场景
场景说明: 基于开源/腾讯商用大语言模型精调专属模型。典型用户画像: 有大模型算法团队,具备通过预训练或精调基底模型迭代出满足业务指标要求模型的能力 缺少能够搭建算力纳管调度,数据存储管理的工程人员

 

 

icon多机多卡训练icon
产品方案
通过快速对接大数据平台或各类数据存储,可视化的建模工具,以及模型灵活管理发布的MLOps能力,实现高效建模和模型发布,提升业务效率;优势点: 大数据一体化方案 - 存储打通+工具融合(TBDS/WEDATA) 训练推理一体化编排 – 提供模型全生命周期可视化管理(MLOps) 内置开箱即用的机器学习算法建模实践
金融行业的典型应用场景
场景说明: 信贷类业务,反欺诈,反洗钱相关的风控场景 理财、基金、保险等产品推荐相关的营销场景。典型用户画像: 已经完成大数据平台建设的金融机构,期望基于自身的营销或风控需求展开模型开发工作 已经完成线下场景建模的金融机构,期望对模型资产进行全生命周期管理

 

 

icon推理加速icon
产品方案
在CV、NLP、OCR等模型推理场景中,提供一键式加速和弹性服务能力,助力客户降本增效。
优势点: 推理加速性能强大:使用TI-ACC加速工具,针对CV、NLP、以及OCR TOP100模型相比原生框架性能提升2倍以上 弹性服务功能丰富:支持基于资源和业务请求量等指标的弹性自动扩缩容、混合弹缩及定时弹缩,保障线上业务稳定性
泛互行业的典型应用场景
场景说明: 提供toB智能客服、商品识别、 AI面试等Saas服务的模型推理场景 面向C端数据进行内容审核等AI应用的模型推理场景。典型用户画像: 业务需要高精度AI模型赋能 AI模型部署规模在10卡-数百卡之间 无专门研究AI加速团队,希望通过外部能力降本增效
客户背景
客户为AI商品识别云服务提供商,商品识别业务场景对识别精度要求较高,使用了Detectron2框架; 推理服务器有一定规模,但没有专门人力研发模型推理加速
解决方案
业务逻辑与模型服务解耦,独立分布部署,按需独立扩容 TI-ACC推理加速,提升模型推理性能,提高吞吐 异步服务架构升级,提高实时性 结合TI推理服务定时弹性伸缩能力,消峰填谷
客户痛点
整体耦合,粗粒度力度扩展,资源利用率低 本身使用Detectron2框架、Python部署,高精度模型推理时延较高,希望低门槛接入优化 服务调用存在固定波峰波谷期,但没有弹性伸缩机制
方案效果
轻量化接入:一键式模型推理加速,然后将加速后模型部署为在线服务,通过公网API接口调用的方式对接自身业务应用 模型性能:平均推理延迟降低3-4倍,QPS提升2-3倍 用户成本:使用低成本T4卡替换高配V100卡SLA不变,降低月成本降低4.5W,年成本降低54W,用户成本降低50%+

 

 

icon教育实训icon
产品方案
教育版TI-ONE深度融合腾学汇沙箱实训平台,为教培实训需求的校企客户提供AI相关项目实训及教学实验的在线实操工具。优势点: 支持数据标注、Notebook、任务式建模等实训工具 支持高并发任务排队机制,可同时支撑百人进行实践训练 支持包含CV,NLP,OCR等各类场景的预置算法和Python,R,PySpark,XGBoost,Tensorflow,Pytorch等框架,可满足不同教学背景和方向的实训课程实践需求
教育行业的典型应用场景
场景说明和典型用户画像: 1.AI课程+AI教具+AI服务:核心在课程,适用于新开设AI专业、缺少完整人工智能人才培养顶层规划的学校,以及需要完善和补充课程内容的学校,基地 2.AI教具+AI服务:核心在教具,适用于课程/内容体系基本完善、需要AI工具用于科研、赛事等活动的学校,企业 3.AI服务+AI教具:核心在服务,适用于需要开展短期培训、沙龙等活动的学校、政府、企业

 

 

icon AI业务管理案例icon
产品方案
基于 TI 平台的 AI 中台解决方案,面向政府和中大型企业的 AI 管理需求,提供 AI 算力集约管理、数据集/模型等 AI 资产管理、AI 服务运维管理等能力,为企业 AI 业务管理提供工具支持。优势点: 支持x86+arm异构算力纳管/调度,兼容主流国产计算卡 支持数据集、模型等核心资产的集约管理、内部分享 支持多租户管理体系,灵活分配算力配额、管控角色权限
智算/数据中心的典型应用场景
场景说明: AI 算力管理:集约管理算力资源,面向不同项目灵活分配配额,集中监控资源使用率、剩余资源量等信息 AI 资产管理:集约管理数据集、模型、算子等AI 资产,合理划分权限,并提供资产分享、流转通道 业务运维管理:面向系统内的服务、资源、资产提供完备的日志、审计、监控、告警等运维管理工具。典型用户画像:政府机构、大型集团型企业,由于下属部门、机构、部门众多,有较强的AI业务管理诉求
客户背景
该客户为政府机构,期望通过该项目整合社会多元异构算力资源,建设市级政务算力统筹调度平台。其中软件平台部分希望形成全链路一站式的人工智能算力服务,充分赋能“人工智能+”至各需求单位
解决方案
基于 TI 平台提供的 AI 中台解决方案,实现对于AI 算力、AI 资产、AI 开发流程的规范化集约管理和统筹调度
客户痛点
高速算力资源供需缺口大,期望通过有效手段提升算力利用率 算力资源分散,缺少统筹调度手段,期望借助平台进行集约管理、统一分配、合理调度 算力需求多元,算力需求方众多,期望进行合理业务区分、权限管控
方案效果
该项目建成后将纳管 300PFLOPS 算力资源,其中 30%为国产化算力 面向全市40多个党政机关、事业单位开放 AI 计算服务,支持其 AI 模型训练、推理业务 助力该市实现“算力一网化、统筹一体化、调度一站式”,将推动实现智能政务算力资源的统筹管理、统一调度

 

 

icon精调产品能力全局视图icon

 

 

icon一键部署大模型icon

TI 内置了目前在多个开源数据集 C-Eval、MMLU 等上取得较好评测指标的开源大模型:hunyuan-large、llama、baichuan、qwen等。且平台会持续跟进开源大模型升级情况更新产品版本

 

 

icon一键部署大模型icon

平台内置了大模型参数文件、推理脚本、推理镜像等部署依赖物料,用户只需额外指定推理所需算力资源,即可一键部署大模型

 

 

icon训练数据icon
数据来源
支持对接 10+ 种来源的训练数据 训练任务可直接挂载用户数据源,无需转存,节省存储空间提高训练数据加载效率
数据格式
平台定义了统一的训练数据格式
同一数据集可对接多个大模型训练任务

 

 

icon训练数据icon
 
 
 
数据导入和管理
平台支持用户本地导入或通过数据源挂载训练数据 统一列表页面纳管训练数据资产
数据查看
支持点击数据集或数据源名称,跳转详情页面,查看具体内容

 

 

icon训练数据icon

 

 

icon训练数据icon
按照不同的业务场景沉淀不同的数据清洗过滤配置
可通过config文件自定义开启数据清洗策略:支持长度过滤、关键词过滤、数据格式准确性校验、数据格式标准化
多维度的可视化数据统计分析
支持柱状图、饼状图可视化分析数据分布情况,可视化预览数据schema结构 可视化展示每一个数据清洗环节的处理进度

 

 

 

icon训练数据icon
数据配比
定义了“通用算法任务”类别树: 涵盖 100+ 任务类别的自研配比数据业界首家详细梳理了算法任务的三级类别树。涵盖 12 大类下的 100+ LLM 建模场景 文本创作, 开放式问答, 基础语言能力, 对话, 角色扮演, 智能体, 思维链. 阅读理解. 文本理解, 信息提取, 知识挖掘, 代码生成 细分超 100w 条自研精调配比数据 客户不同场景定向选择不同类型的配比数据,相较于竞品无差别随机采样配比数据能更进一步提高模型精调效果
自动调节数据配比科学比例
客户自有训练数据量在10万级别以上,建议混合内置数据和客户自有数据比例 1:1: 大于 1:1 时,被选择的叶子结点的所有数据混合后按比例随机抽取; 小于 1:1 时,则只混合被选择到的内置自研数据即可。 客户自有训练数据量在10万级别以下: 内置自研数据抽取条目数量:min(10w, 用户训练数据量*5)

 

 

icon数据标注icon
 
TI 平台灵活的 schema 支持的标注场景包括但不限于
高质量文本问答对筛选
文本数据清洗
图片问答对审核/修改
图片问答竞品评测
图片多轮问答
多模态阅读理解
图片文本描述

 

 

icon训练数据icon

 

 

icon训练数据icon

 

 

icon训练数据icon

 

 

icon平台内置大模型icon
开源大模型
llama、baichuan、qwen、等主流大模型。全面接入业界主流开源大模型 提供更丰富的模型选择
自研混元大模型
389B MoE混元大模型
自研行业大模型
金融、汽车行业大模型

 

 

icon平台内置大模型:自研混元 核心优势icon

更可靠——相比主流开源大模型将幻觉降低30%~50%。Prompt:写一篇作文,尝试论证关羽和秦琼谁的战斗力更强?

 

 

icon平台内置大模型:自研混元 核心优势icon

更成熟——提高超长文本的处理效果,一口气生成千字长文。Prompt:请帮我写一篇专利,专利的主要内容是:本发明涉及农业种植技术领域,具体是一种农业种植用种子筛选装置,筛选机构与除尘机构之间设置有震动机构,本发明,通过设置除尘机构,一方面,第一风机可以将种子中含有的细小杂质吹起,另一方面,可以实现除尘箱和放置框的上下震动,使筛分更加快速有效的进行。 不少于4k字

 

 

icon平台内置大模型:自研混元 核心优势icon

更成熟——具备更强的逻辑推理能力,能结合实际场景推理决策。Prompt:我们公司去年有员工315人,其中90后占全公司人数的1/5。今年又招进了一批90后,让90后人数占到了全公司人数的30%。所以今年招了多少90后?

 

 

icon上传自定义大模型icon

若平台内置的开源大模型无法满足用户需求,用户也可自行下载模型文件上传 TI 平台。

 

 

icon训练镜像icon

平台为用户内置了一个统一的 LLM 训练镜像,默认安装了大多数大语言模型需要的依赖包

支持 transformers 模型训练以及 deepspeed 分布式训练能力等

 

 

icon训练镜像:自研训练加速框架 Angel 技术原理icon

 

 

icon启动训练任务icon
 
 
精调模式
平台内置了全参数 Full 和 Lora 两种精调模式 用户可通过 {FinetuningType: Full/Lora} 指定
任务超参
平台开放了部分超参供用户自定义调整 {Epoch、BatchSize、LearningRate、Step、MaxSequenceLength等} 其中,通过 UseTilearn 参数控制是否启用自研加速

 

 

icon启动训练任务icon
定义了“通用算法任务”类别树: 涵盖 100+ 任务类别的自研配比数据
业界首家详细梳理了算法任务的三级类别树
涵盖 12 大类下的 100+ LLM 建模场景 文本创作, 开放式问答, 基础语言能力, 对话, 角色扮演, 智能体, 思维链. 阅读理解. 文本理解, 信息提取, 知识挖掘, 代码生成 细分超 100w 条自研精调配比数据 客户不同场景定向选择不同类型的配比数据,相较于竞品无差别随机采样配比数据能更进一步提高模型精调效果
自动调节数据配比科学比例
客户自有训练数据量在10万级别以上,建议混合内置数据和客户自有数据比例 1:1: 大于 1:1 时,被选择的叶子结点的所有数据混合后按比例随机抽取; 小于 1:1 时,则只混合被选择到的内置自研数据即可。 客户自有训练数据量在10万级别以下: 内置自研数据抽取条目数量:min(10w, 用户训练数据量*5)

 

icon训练任务监控icon

大模型训练周期长、代价大,TI 平台提供丰富的训练任务监控数据,供用户实时掌控训练情况

 

 

icon模型评测icon

贴合算法真实使用流程,抽象出“轻量体验、客观评测、主观评测”三个评测阶段

客户服务
提供该训练任务产出的全量 ckpt 列表 
针对 ckpt 维度提供“轻量体验”的快速入口网页问答快速试一试难例效果 
针对 ckpt 维度提供“客观评测”的快速入口,一键评测输出客观指标报告 目标用户:训练人员
员工服务
提供独立的“主观评测”页面 
支持灵活评测“训练任务产出、cfs路径、平台内置”多种来源的大模型
目标用户:评测人员

 

 

icon模型评测 – 轻量体验icon

1. 提供该训练任务产出的全量 ckpt 列表 2. 轻量体验是指您将训练任务中保存的中间模型 checkpoint 进行部署,并对模型效果进行体验,能快速体验模型效果是否符合预期。 3. 针对 ckpt 维度提供“轻量体验”的快速入口,网页问答快速试一试难例效果 4. 目标用户:训练人员 5. 建议训练到 0.5epoch 启动轻量体验。根据关键的任务要求,重点体验模型的回复是否符合预期。例如用户在训练集中加入了按 Markdown 格式输出,或者特殊语气回复的数据,则可以通过轻量体验,检验模型是否学到了这样的能力。如果模型在关键任务中的回复与预期差异较大,认为是模型学习失败,需要及时排查模型训练超参以及训练数据是否正确

 

 

icon模型评测 – 客观评测icon

 

 

icon模型评测 – 主观评测icon

1. 提供独立的“主观评测”页面 2. 支持灵活评测“训练任务产出、cfs路径、平台内置”多种来源的大模型 3. 目标用户:评测人员 4. 自定义评测集仅支持 jsonl、csv的格式,里面内容为2列,分别为“prompt”  和“answer”。 5. 配置推理超参举例如下: {"max_tokens": 256,"temperature": 0.6,"top_p": 0.8,"top_k": 5,"do_sample": true,"repetition_penalty": 1.2} 6. 针对主观评测中标注经验,建议您根据实际的业务需求仔细制作主观评测集,包括问题、参考答案与打分标准。其中打分标准越细节越客观越好。例如针对摘要能力的主观评测,可以设置需要包含关键信息一、二、三等要求,如果有遗漏则扣1分。完成主观评测集后,需要对标注同学进行培训,并在标注过程中进行交叉校验,以确保多人审核标准的一致性。

 

 

icon产品架构icon

训练任务完成后,会输出并保存训练过程中产生的所有 checkpoint 模型文件

 

 

icon推理服务icon

TI-ONE模型部署+Angel推理加速,助力长期稳定高效推理

 

 

icon推理服务:在线推理服务用户使用链路详解icon

TI-ONE模型部署+Angel推理加速,助力长期稳定高效推理

 

 

icon推理服务:模型制作和导入icon

 

 

 

icon推理服务:镜像制作和导入icon
 
 
容器镜像服务
支持直接拉取腾讯云容器镜像服务中的镜像文件
指定镜像地址
支持拉取可访问的任务镜像仓库中的镜像文件

 

 

icon推理服务:创建底层算力资源组icon

 

 

icon推理服务:推理服务发布icon
创建推理服务
多种计费模式(按量,包月,按量+包月) 多种部署方式(单副本单节点部署,单副本多节点分布式部署)
配置推理服务容器
加载多来源模型文件(模型仓库,COS,CFS)
配置弹性伸缩、限流、鉴权等
定时扩缩容 HPA扩缩容(CPU,内存,GPU使用率,单副本qps) 组合扩缩容(资源组+按量)

 

 

icon推理服务:使用的弹性伸缩icon

解决问题:高并发业务调用量突然增大时(如QPS从 1000 突增至 3000),算法服务能够快速扩容资源、保障业务快速恢复正常。 容器弹性伸缩:TI-ONE平台支持配置容器实例的水平伸缩,可以基于时间配置或基于资源使用率、接口调用并发数等配置。 服务器弹性伸缩:当TI-ONE资源组中的资源不足时,可以将POD谈到按量计费的托管资源中

 

 

icon推理服务:配置监控告警规则icon
 
 
 
 
支持服务不停服滚动更新及灰度流量分配,确保服务持续在线可用 支持实例级别的手工/动态算力资源扩缩,高效利用集群算力
支持服务环境变量设置, 提供configmap/secret配置管理,适配容器环境的高级运行要求
支持登陆容器环境进行进行服务管理

 

 

icon推理服务:配置监控告警规则icon

解决问题:算法服务监控问题,保证算法稳定运行,异常及时通知处理。 业务监控:指在线推理服务的监控。支持在TI-ONE平台监控,也可以在云监控DashBoard监控。监控指标包括:CPU、GPU、内存、实例运行数量等资源层的指标 + 接口失败调用量、接口调用总量、服务平均响应时间、服务每秒请求数、qps等业务层的指标。 资源监控:指TI-ONE底层资源组的监控。支持在TI-ONE平台监控,也可以在云监控DashBoard监控。监控指标包括:CPU、GPU、内存、实例运行数量等资源层的指标。 分部门、分用户的业务监控:指不同部门/用户的访问信息、调用量、日志信息等。需将访问调用情况接入日志服务,上报日志需包含请求header等标识部门/用户的参数,通过日志服务+相应参数来标识不同的部门或用户。 同时,可以配置云监控DashBoard、日志大盘DashBoard等,统一展示调用量等信息。 告警+通知:支持基于监控指标配置告警规则,支持推送到企微webhook、短信/邮件/电话通知等渠道。

 

 

icon产品架构icon

Angel方案和技术优势。自研优化了多种推理框架,包括vllm,deepspeed,trt-llm(当前主推vllm) 更多量化方式支持,不仅节省显存,提升吞吐,也可以降低推理延迟。 Lookahead并行解码,RAG场景性能提升明显。 更多并行方式:支持TP,PP, TP + PP。 优化sampling过程,使用算子融合以及算子改写等,提升解码效率。 实现system prompt cache优化,system prompt由每次请求都需要计算到所有请求只需要计算一次。 开发flash attention和remove padding功能,提升首token性能。长输入首token性能提升20%到1倍。

 

 

icon推理加速: Sampling及batch优化icon

 

 

产品推荐

木棉树数字孪生可视化开发平台
木棉树数字孪生可视化开发平台有别于传统的3D可视化,3D可视化是数字孪生成果的表达工具;而mms3D数字孪生引擎专为工业物联网领域设计,能更好的为现实世界服务,比传统的3D可视化功能更强大。在数字虚拟空间中,能通过孪生系统反向控制物理世界的运行,这样才能更好地管理运营现实世界。
免费试用
查看详情
百度VR煤矿生产安全虚拟实训系统
百度VR煤矿生产安全虚拟实训系统,VR生产实训体验系统,采用先进成熟的VR、 3D、多媒体等技术,以三维动态的形式全真模拟出施工真实场景和各类险情,实现3D动态漫游,达到生产安全教育交底和培训演练的目的。
免费试用
查看详情
小泥人冰雪场馆SaaS管理系统
小泥人冰雪场馆 SaaS 管理系统,整合滑雪场一卡通、售票收银及智能押金收退还功能。提供票务全流程管理、消费一卡通服务及押金智能处理,集成数据统计、客流分析,适配冰雪场馆高效运营需求。是场馆管理优选系统。
免费试用
查看详情
佑尔安智慧城市管控一体化平台
佑尔安智慧城市管控一体化平台,融合 GIS+AR 可视化管控系统、城市态势分析系统及城市预警与调度系统。可实现全域可视化监管、多维度态势研判、精准预警与高效调度,适配城市治理场景,提升应急响应与协同能力,助力智慧城市建设。
免费试用
查看详情