
业务挑战:模型构建与应用仍存在诸多挑战
TI-ONE核心能力:提供包含辨别式AI和生成式AI的一站式AI开发解决方案

腾讯云TI平台TI-ONE公有云 – 产品架构

运营支持维度
大模型精调

多机多卡训练

推理加速
教育实训

AI业务管理案例
精调产品能力全局视图

一键部署大模型
TI 内置了目前在多个开源数据集 C-Eval、MMLU 等上取得较好评测指标的开源大模型:hunyuan-large、llama、baichuan、qwen等。且平台会持续跟进开源大模型升级情况更新产品版本

一键部署大模型
平台内置了大模型参数文件、推理脚本、推理镜像等部署依赖物料,用户只需额外指定推理所需算力资源,即可一键部署大模型

训练数据

训练数据

训练数据

训练数据

训练数据

数据标注

训练数据

训练数据

训练数据

平台内置大模型
平台内置大模型:自研混元 核心优势
更可靠——相比主流开源大模型将幻觉降低30%~50%。Prompt:写一篇作文,尝试论证关羽和秦琼谁的战斗力更强?

平台内置大模型:自研混元 核心优势
更成熟——提高超长文本的处理效果,一口气生成千字长文。Prompt:请帮我写一篇专利,专利的主要内容是:本发明涉及农业种植技术领域,具体是一种农业种植用种子筛选装置,筛选机构与除尘机构之间设置有震动机构,本发明,通过设置除尘机构,一方面,第一风机可以将种子中含有的细小杂质吹起,另一方面,可以实现除尘箱和放置框的上下震动,使筛分更加快速有效的进行。 不少于4k字

平台内置大模型:自研混元 核心优势
更成熟——具备更强的逻辑推理能力,能结合实际场景推理决策。Prompt:我们公司去年有员工315人,其中90后占全公司人数的1/5。今年又招进了一批90后,让90后人数占到了全公司人数的30%。所以今年招了多少90后?

上传自定义大模型
若平台内置的开源大模型无法满足用户需求,用户也可自行下载模型文件上传 TI 平台。

训练镜像
平台为用户内置了一个统一的 LLM 训练镜像,默认安装了大多数大语言模型需要的依赖包
支持 transformers 模型训练以及 deepspeed 分布式训练能力等

训练镜像:自研训练加速框架 Angel 技术原理

启动训练任务

启动训练任务

训练任务监控
大模型训练周期长、代价大,TI 平台提供丰富的训练任务监控数据,供用户实时掌控训练情况

模型评测
贴合算法真实使用流程,抽象出“轻量体验、客观评测、主观评测”三个评测阶段

模型评测 – 轻量体验
1. 提供该训练任务产出的全量 ckpt 列表 2. 轻量体验是指您将训练任务中保存的中间模型 checkpoint 进行部署,并对模型效果进行体验,能快速体验模型效果是否符合预期。 3. 针对 ckpt 维度提供“轻量体验”的快速入口,网页问答快速试一试难例效果 4. 目标用户:训练人员 5. 建议训练到 0.5epoch 启动轻量体验。根据关键的任务要求,重点体验模型的回复是否符合预期。例如用户在训练集中加入了按 Markdown 格式输出,或者特殊语气回复的数据,则可以通过轻量体验,检验模型是否学到了这样的能力。如果模型在关键任务中的回复与预期差异较大,认为是模型学习失败,需要及时排查模型训练超参以及训练数据是否正确

模型评测 – 客观评测

模型评测 – 主观评测
1. 提供独立的“主观评测”页面 2. 支持灵活评测“训练任务产出、cfs路径、平台内置”多种来源的大模型 3. 目标用户:评测人员 4. 自定义评测集仅支持 jsonl、csv的格式,里面内容为2列,分别为“prompt” 和“answer”。 5. 配置推理超参举例如下: {"max_tokens": 256,"temperature": 0.6,"top_p": 0.8,"top_k": 5,"do_sample": true,"repetition_penalty": 1.2} 6. 针对主观评测中标注经验,建议您根据实际的业务需求仔细制作主观评测集,包括问题、参考答案与打分标准。其中打分标准越细节越客观越好。例如针对摘要能力的主观评测,可以设置需要包含关键信息一、二、三等要求,如果有遗漏则扣1分。完成主观评测集后,需要对标注同学进行培训,并在标注过程中进行交叉校验,以确保多人审核标准的一致性。

产品架构
训练任务完成后,会输出并保存训练过程中产生的所有 checkpoint 模型文件

推理服务
TI-ONE模型部署+Angel推理加速,助力长期稳定高效推理

推理服务:在线推理服务用户使用链路详解
TI-ONE模型部署+Angel推理加速,助力长期稳定高效推理

推理服务:模型制作和导入

推理服务:镜像制作和导入

推理服务:创建底层算力资源组

推理服务:推理服务发布

推理服务:使用的弹性伸缩
解决问题:高并发业务调用量突然增大时(如QPS从 1000 突增至 3000),算法服务能够快速扩容资源、保障业务快速恢复正常。 容器弹性伸缩:TI-ONE平台支持配置容器实例的水平伸缩,可以基于时间配置或基于资源使用率、接口调用并发数等配置。 服务器弹性伸缩:当TI-ONE资源组中的资源不足时,可以将POD谈到按量计费的托管资源中

推理服务:配置监控告警规则

推理服务:配置监控告警规则
解决问题:算法服务监控问题,保证算法稳定运行,异常及时通知处理。 业务监控:指在线推理服务的监控。支持在TI-ONE平台监控,也可以在云监控DashBoard监控。监控指标包括:CPU、GPU、内存、实例运行数量等资源层的指标 + 接口失败调用量、接口调用总量、服务平均响应时间、服务每秒请求数、qps等业务层的指标。 资源监控:指TI-ONE底层资源组的监控。支持在TI-ONE平台监控,也可以在云监控DashBoard监控。监控指标包括:CPU、GPU、内存、实例运行数量等资源层的指标。 分部门、分用户的业务监控:指不同部门/用户的访问信息、调用量、日志信息等。需将访问调用情况接入日志服务,上报日志需包含请求header等标识部门/用户的参数,通过日志服务+相应参数来标识不同的部门或用户。 同时,可以配置云监控DashBoard、日志大盘DashBoard等,统一展示调用量等信息。 告警+通知:支持基于监控指标配置告警规则,支持推送到企微webhook、短信/邮件/电话通知等渠道。

产品架构
Angel方案和技术优势。自研优化了多种推理框架,包括vllm,deepspeed,trt-llm(当前主推vllm) 更多量化方式支持,不仅节省显存,提升吞吐,也可以降低推理延迟。 Lookahead并行解码,RAG场景性能提升明显。 更多并行方式:支持TP,PP, TP + PP。 优化sampling过程,使用算子融合以及算子改写等,提升解码效率。 实现system prompt cache优化,system prompt由每次请求都需要计算到所有请求只需要计算一次。 开发flash attention和remove padding功能,提升首token性能。长输入首token性能提升20%到1倍。
推理加速: Sampling及batch优化




