
小红书数据架构

基于ClickHouse的即席分析
成本高、扩容难、数据时效性差。

Lambda架构&存算分离

应用场景-用户行为分析平台

2.0 Lambda&存算分离总结
业务收益:秒级时延分析、200+产品业务高度自助、万亿数据规模10S响应。
3.0 Lakehouse
如何让全量的数仓数据资产发挥更大价值,支持更丰富的业务场景分析
业内基本形成共识的解决方案:Lakehouse,基于湖上建仓。
2.0 问题(架构的割裂):2套数据存储、2套计算框架、CK缺少ETL能力

3.0 Lakehouse 技术选型
Iceberg:最早22年用作用户日志的存储格式,目前来看lceberg成为事实上的数据湖标准
StarRocks:20年作为实时数仓构建引入小红书,目前已经有大量集群提供线上服务。
Flink入湖、Iceberg数据存储、Spark业务加工、StarRocks查询加速

3.0 Lakehouse查询加速:Z-Order智能排序

3.0 查询性能收益
数据文件压缩率相比CK提升1倍
查询P90性能提升大约3倍。

3.0 应用场景:业务经营数据自助

3.0 Lakehouse 收益
业务收益
覆盖业务体系核心场景,业务用户使用渗透>70%覆盖核心分析场景
官方数据集收敛到300个,
当前湖仓数据整体规模超过300PB,日增4PB
4.0 增量计算
有没有一套计算框架实现了类似Snowflake的Dynamic Table能力?
一个实时任务的开发,往往是一个离线任务开发工作量的3倍左右;且会面临数据回刷、资源锁定、任务稳定性、带状态恢复等问题

4.0 增量计算-云器POC

4.0 增量计算-云器合作项目
高效的引擎处理性能。

4.0 应用场景-实时实验分析
标准数仓开发模式,对离线Spark业务逻辑快速复刻到增量计算
支持非结构化数据存储,高效分析
丰富索引能力,比如倒排索引优化,DataSkipping效率提升10倍
一体化的架构,让整个链路更清晰,开发维护成本更低。

4.0 增量计算-业务效果
当前已上线社区、搜索、商业、电商多个业务场景,成为算法同学日常工作的必备数据分析能力。

计算模式对比&应用场景
增量计算当前在分钟级时延的数据场景在资源消耗、开发成本已经数据更新频率上达到了很好的平衡;接下来湖仓模式逐步的普及下,这种计算模式也会逐步应用在更多的数据场景中。

展望
湖仓一体:lceberg生态下更快速的查询性能以及更高的数据新鲜度技术优化
流批一体:持续探索增量计算和现有的离线加工计算框架融合,持续推进 Kappa架构在生产环境下的方案实践
AI自助:探索在Lakehouse架构下AI的适用场景和最佳实践,进一步降低业务用数门槛,更多挖掘数据价值。
什么是 通用增量计算?

什么是 通用增量计算?

什么是通用增量计算?

什么是 通用增量计算?
通用增量计算(Generic Incremental computing,GIc)是一种同时面向高性能和低延迟优化的新计算模式。当上游数据在不断发生变更的时候,通过只计算数据变化的部分,与之前的查询结果合并,快速的生成对应的最新査询结果。是一种以最小的运算成本最快的速度计算出最新的查询结果的新技术。。
通用增量计算的4个标准
通用增量计算的效果-3个1/3

AI时代D+A架构选型5个原则(总结)
数据到智能
What/why 云器科技?




