1. Hudi
Apache Hudi是一个Data Lakes的开源方案,Hudi是Hadoop Updates and Incrementals的简写, 它是由Uber开发并开源的Data Lakes解决方案。Hudi能够基于HDFS之上管理大型分析数据集,可以对数据进行插入、更新、增量消费等操作, 主要目的是高效减少摄取过程中的数据延迟。Hudi非常轻量级,可以作为lib与Spark、Flink进行集成,
1.1. 数据湖的基本理解
数据湖强调“先存后用”,适合承接结构化、半结构化和非结构化数据。和传统数仓相比,它更适合作为原始数据沉淀层与大规模离线分析底座。
2. reference
3. 延伸理解
- Hudi 更强调增量更新与近实时摄取。
- Iceberg 更强调表格式管理和计算引擎兼容性。
- Delta Lake 更常见于 Spark 生态。