Skip to content
发布于 更新于

1. Hudi ​

Apache Hudi是一个Data Lakes的开源方案,Hudi是Hadoop Updates and Incrementals的简写, 它是由Uber开发并开源的Data Lakes解决方案。Hudi能够基于HDFS之上管理大型分析数据集,可以对数据进行插入、更新、增量消费等操作, 主要目的是高效减少摄取过程中的数据延迟。Hudi非常轻量级,可以作为lib与Spark、Flink进行集成,

1.1. 数据湖的基本理解 ​

数据湖强调“先存后用”,适合承接结构化、半结构化和非结构化数据。和传统数仓相比,它更适合作为原始数据沉淀层与大规模离线分析底座。

2. reference ​

3. 延伸理解 ​

  • Hudi 更强调增量更新与近实时摄取。
  • Iceberg 更强调表格式管理和计算引擎兼容性。
  • Delta Lake 更常见于 Spark 生态。

基于 VitePress + GitHub Actions 自动部署