立即咨询

电话咨询

微信咨询

立即试用
商务合作

云器科技Lakehouse小红书数据架构解决方案

云器科技 Lakehouse 湖仓一体小红书数据架构解决方案,集成通用增量计算数据重构降本方案核心能力。可实现小红书数据湖仓一体化管理,通过增量计算与数据重构优化存储成本,提升数据处理效率,助力精准运营决策。
立即咨询

 

icon小红书数据架构icon

 

数据分析
BI、报表、自助分析;洞察数据
数据产品
各种面向广告主、商家、博主的数据平台
特征画像
提供用户画像、特征标签·作为推荐搜索、商业等算法策略的输入
Data Agent
数据提取、增强分析、智能问答、分析报告

 

 

icon基于ClickHouse的即席分析icon

成本高、扩容难、数据时效性差。

 

 

iconLambda架构&存算分离icon

 

存算分离
延长了数据集的生命周期降低成本
Lambda架构
提升数据时效

 

icon应用场景-用户行为分析平台icon

 

关联优化
用户特征X行为分析
物化视图优化
6000亿->100亿覆盖70%查询
索引构建优化
用户细查

 

 

icon2.0 Lambda&存算分离总结icon

业务收益:秒级时延分析、200+产品业务高度自助、万亿数据规模10S响应。

 

 

icon 3.0 Lakehouseicon

如何让全量的数仓数据资产发挥更大价值,支持更丰富的业务场景分析

业内基本形成共识的解决方案:Lakehouse,基于湖上建仓。

2.0 问题(架构的割裂):2套数据存储、2套计算框架、CK缺少ETL能力

 

 

icon3.0 Lakehouse 技术选型icon

Iceberg:最早22年用作用户日志的存储格式,目前来看lceberg成为事实上的数据湖标准

StarRocks:20年作为实时数仓构建引入小红书,目前已经有大量集群提供线上服务。

Flink入湖、Iceberg数据存储、Spark业务加工、StarRocks查询加速

 

 

icon3.0 Lakehouse查询加速:Z-Order智能排序icon

 

 

 

icon3.0 查询性能收益icon

数据文件压缩率相比CK提升1倍
查询P90性能提升大约3倍。

 

 

icon3.0 应用场景:业务经营数据自助icon

 

 
逻辑视图
收敛数据集数量,统一口径定义,降低理解成本
提升数据集业务覆盖度,降低数仓ETL加工成本
按需智能裁剪
物化加速
构建流程:发现->生产->消费
BitMap去重优化,告别传统CUBE加工模式
直接用DWS表搭建看板业

 

 

icon3.0 Lakehouse 收益icon

业务收益
覆盖业务体系核心场景,业务用户使用渗透>70%覆盖核心分析场景

官方数据集收敛到300个,
当前湖仓数据整体规模超过300PB,日增4PB

 

 

icon4.0 增量计算icon

有没有一套计算框架实现了类似Snowflake的Dynamic Table能力?

一个实时任务的开发,往往是一个离线任务开发工作量的3倍左右;且会面临数据回刷、资源锁定、任务稳定性、带状态恢复等问题

 

 

icon4.0 增量计算-云器POCicon

 

 

 

 

icon4.0 增量计算-云器合作项目icon

高效的引擎处理性能。

功能验证
1、对当前Spark任务作业改写成本不高
2、数据正确性验证通过
3、可以在freshness间隔与成本间做灵活调节
性能验证(FreshPer5min)
1、纯增量表相比离线Spark性能提升1-2倍
2、全量订单表更新,成本与Spark齐平
3、实时汇总任务,资源成本约为Flink的1/4
 
 

 

 

 

icon4.0 应用场景-实时实验分析icon

标准数仓开发模式,对离线Spark业务逻辑快速复刻到增量计算

支持非结构化数据存储,高效分析
丰富索引能力,比如倒排索引优化,DataSkipping效率提升10倍

一体化的架构,让整个链路更清晰,开发维护成本更低。

 

 

 

icon4.0 增量计算-业务效果icon

当前已上线社区、搜索、商业、电商多个业务场景,成为算法同学日常工作的必备数据分析能力。

 

 

 

icon计算模式对比&应用场景icon

增量计算当前在分钟级时延的数据场景在资源消耗、开发成本已经数据更新频率上达到了很好的平衡;接下来湖仓模式逐步的普及下,这种计算模式也会逐步应用在更多的数据场景中。

 

 

 

 

icon展望icon

湖仓一体:lceberg生态下更快速的查询性能以及更高的数据新鲜度技术优化
流批一体:持续探索增量计算和现有的离线加工计算框架融合,持续推进 Kappa架构在生产环境下的方案实践
AI自助:探索在Lakehouse架构下AI的适用场景和最佳实践,进一步降低业务用数门槛,更多挖掘数据价值。

 

 

icon什么是 通用增量计算?icon

 

 
 
 
 
1、“三角”表达的是 多样的业务需求与平衡
2、为了满足这种多样的平衡,分别诞生了批、流、交互引擎,以及Lambda 架构

 

 

icon什么是 通用增量计算?icon

 

 
1、“三角”表达的是 多样的业务需求与平衡
2、为了满足这种多样的平衡,分别诞生了批、流、交互引擎,以及Lambda 架构
3、“数据不可能三角”不可能被打破,但可以用更简化的架构满足
统一的数据,
统一的计算表达
灵活的调节能力(Eg.只修改配置)
媲美当前各个平衡点最好的性能
4、如何实现一套Kappa架构满足上述需求,是个10年的问题
5、上述挑战,在AlInfra中同样存在

 

 

icon什么是通用增量计算?icon

 

 
Benefits of Medallion Architecture
Benefits of Medallion Architecture
Flexibility: Supports diverse use cases, from raw data storage to advanced analytics.
Data Quality Management: Each layer progressively enhances dataquality, ensuring trustworthiness
Cost Efficiency: Allows organizations to prioritize resources for high.
value transformations in the Gold layer.
Incremental ETL: Data can be processed in stages, reducing complexity and improving scalability

 

 

icon什么是 通用增量计算?icon

通用增量计算(Generic Incremental computing,GIc)是一种同时面向高性能和低延迟优化的新计算模式。当上游数据在不断发生变更的时候,通过只计算数据变化的部分,与之前的查询结果合并,快速的生成对应的最新査询结果。是一种以最小的运算成本最快的速度计算出最新的查询结果的新技术。。

系统架构:淘汰Lambda,实现Kappa
一套引擎,提供面向数据新鲜度、查询性能和资源成本三方面的多种平衡点,支持在平衡点之间做简单灵活的调节。
计算模式:统一流、批、交互三种模式
统一的接口,统一的语法/语义,统一且开放的数据表达(使得可以被其他引擎/工具消费)。并保持经典数据建模形态:
1、数据分层(例如经典:ODS、DWD、ADS分层)
2、开放可查询
3、基于MVCC的数据可重算。
数据表达:统一语法/语义,支持Medellion     Architecture
面向通用场景,通过一套增量计算逻辑,统一当前的流、批、交互三种模式。
通用框架:同时支持Data+AI得负载
是一套通用分布式架构,支持非关系计算支持多种语言:SQL+AlFunc,Python/PySpark。

 

icon通用增量计算的4个标准icon

 

S
Standard SQL with Full Syntax/Semantics
One Standard and Unified SQL
支持完整语法和语义(非确定性函数除外)
支持UDF(替换批处理)
O
Open Format
数据采用标准的表达方式,可以被其他引擎高效消费(例如,采用标准的lceberg+Parquet格式。其他引擎可以直读)
能支持标准的数仓模型和数据分层(E.g.当前主流的维度建模分层ODS/DWD/ADS)。
P
Performance
能同时获得批处理的高吞吐/低成本以及流处理的低延迟/高实时性
如何准确的识别增量数据,以及如何利用之前的计算结果,是性能优化的关键,不够优化的增量算法,可能带来100X级别的计算量增加。
T
Trade-off seamlessly between T+0 and T+1
调度与SQL业务逻辑正交
基于参数动态调整调度周期即可

 

icon通用增量计算的效果-3个1/3icon

 

资源成本降低至之前的1/3,同时提升实时性T1到10min
高性能的增量引擎
全增量模式,无计算/存储冗余
平台组件数量降低至原来的1/3
引擎收敛至一个,同时替换 批/流/交互分析三个引擎
存储收敛至一个,消除数据同步的系统和开销
开发成本降低至原来的1/3
一套代码开发全链路统-语法语义
接近无缝升级当前基于Spark的数仓
不需要增量语法,兼容 批处理SparkSQL、PySpark
主流维度建模兼容
需要Lakehouse升级(基于Apache lceberg)

 

 

iconAI时代D+A架构选型5个原则(总结)icon

数据到智能

AI时代,数据是企业最大的差异化竞争力
在AI时代,数据是企业最大的差异化竞争力,驱动业务创新与发展。
Al-centric平台
以AI为核心的平台设计,让人在系统中扮演评审与观察角色,提升效率。
多模态数据融合构建统一知识库
通过融合多源数据,企业能够打造统一的知识库,提升决策的准确性。
Medallion/Kappa架构-通用增量
基于通用增量计算的Medallion模型,助力企业实现高效的Kappa架构。
Lakehouse作
Lakehouse作为新型数据架构,为企业的数据存储与分析提供坚实基础。。

 

 

 

iconWhat/why 云器科技?icon

 

 

 

产品推荐

亿信华辰睿治智能数据治理平台
睿治数据治理平台是由多个产品组成的一整套解决方案,是一款面向实施人员的、智能的、敏捷的数据全生命周期管理应用平台。平台以元数据为基础,所有模块并非串连,而是每个模块都可以单独或与其他模块组合使用,并支持在本地或云上使用。
免费试用
查看详情
知道创宇大模型内生安全评测服务
知道创宇大模型内生安全评测服务,搭建完善 AI 内容安全评估体系,面向模型研发企业、行业用户及监管单位提供专业测评能力。覆盖大模型内容合规检测、代码生成风险检测等多维度检测场景,全方位排查大模型内生安全隐患,规范 AI 应用运行环境,护航中文大模型安全研发、合规落地与规模化商用部署。
免费试用
查看详情
日志易机器大数据智能分析平台
日志易机器大数据智能分析平台,实时监控交易指标、应用程序运行状态及用户行为等,可将异常事件告警通过短信、邮件等方式发送给相关人员。依靠Tracing调用链或日志相关性自动撮合功能,实现端到端的性能监控、业务关联分析及健康度可视化。
免费试用
查看详情
甄一科技一步云AI订单交期助手
甄一科技一步云 AI 订单交期助手,专业 OTD 订单交期协同管理与 AI 履行系统。依托 AI 技术助力企业智能完成交期答复与订单承诺,通过全链路数据协同实现生产排程、物料匹配及交期预警,提升订单履行效率。支持多场景交期管理与智能决策,是制造业订单协同与交期把控的优选 AI 系统。
免费试用
查看详情