大多数大数据企业在构建数仓时采用Lambda架构,一条离线数仓链路,一条实时数仓链路。一些实时业务多的公司构建数仓时采用Kappa架构,但是也避免不了离线处理一些数据,所以一些公司也采用Kappa架构+Lambda架构方式构建数仓。以上不同的架构都有各自的优点及缺点,这里不再赘述。批数据处理与流式数据处理的不同效率决定了针对两类数据采用不同的架构进行分析处理,未来数据仓库的发展也终将走向批数据和流数据使用同一套架构处理,同时也要求批数据及流数据存储上也需要统一,这就所说的批流一体,那么使用什么技术可以既能满足批数据海量存储分析又能满足实时数据存储的效率高、支持数据更新删除?数据湖技术应运而生。Hudi 就是典型的数据湖技术,支持批数据和流式数据的存储,同时还支持高效的OLAP分析查询。 这份资料将会带领大家学习为什么要用数据湖技术、Hudi Timeline、Hudi文件格式及索引、Hudi表类型、Hudi与Spark、Flink框架整合等知识,如果你在学习、工作中针对批流一体数据处理场景正不知选择何种技术,在工作中使用到数据湖技术,那么下载这份资料绝对没错,可以快速学习真正使用数据湖
2022-06-04 09:07:16 60.19MB 数据湖 大数据技术
2021移动云数据湖技术论坛(DataFunSummit 2021)PPT汇总,共5份。 1、移动云数据湖分享 2、移动云湖仓一体的探索与实践 3、Apache Kyuubi (Incubating) 介绍 4、Apache kyuubi在移动云的实践 5、FlinkX在数据入湖中的应用
2021-12-01 18:08:05 16.47MB 2021移动云数据湖技术论坛
精品,数据湖技术及实践与案例精选资料大合集,共40份。 一、数据湖解决方案和相关资料 毕马威数据湖数据管控平台 打造数据增量计算新架构 - 网易数据湖调研&实践 华为数据湖探索用户指南 华为数据湖治理中心数据治理方法论 华为数据湖治理中心用户指南 基于 AWS 数据湖打造 “千人千面”的互联网广告平台 基于数据湖的精准广告投放系统技术解密 基于数据湖构建云上的数据分析架构 基于Serverless的USQL数据湖分析实践 借助 AWS Lake Formation 构建云上数据湖 亚马逊云科技:数据湖解决方案 易经布道数据湖 云端的数据湖:现代化的数据架构 AWS数据湖及大数据服务助力 快消行业进行数字化转型 SuperSQL:数据湖时代的高性能SQL引擎 USQL:数据湖分析 城市数据湖-新一代数字经济基础设施 用大数据来优化数据管理与数据湖建设 二、数据湖实践和案例 基于Flink+Iceberg构建企业级实时数据湖 实时金融数据湖 数据湖存储架构选型 数据湖分析之Upsert详解 数据湖技术IceBerg如何解决腾讯看点业务痛点 数据湖在网易的实践 网易数据湖调研与实践 Flink如何实时分析Iceberg数据湖的CDC数据 三、2021 GIAC 全球互联网架构大会-数据湖论坛 七牛云异构数据湖 (Data Lake)实践 字节跳动基于Iceberg 的海量特征存储实践 B站数据湖的探索与落地实践 Databricks使用Delta Lake构建湖仓一体 四、2020阿里云数据湖高峰论坛发布资料合集 阿里云数据湖应用实践白皮书 阿里云云原生数据湖体系 数据湖解决方案-本地生活行业应用最佳实践 数据湖解决方案-互金行业应用最佳实践 数据湖解决方案-互娱行业应用最佳实践 数据湖解决方案-教育行业应用最佳实践 数据湖解决方案-游戏行业应用最佳实践 数据湖解决方案-最佳实践案例集 数据湖解决方案-AI行业应用最佳实践
2021-09-22 21:06:19 292.94MB 数据湖技术 数据湖案例 数据湖实践
文章分享
2021-01-28 04:26:13 6.14MB iceberg flink
1