大数据
HDFS·Spark·Kafka·Flink
- 001 入门 大数据概述 大数据概念、5V特征、技术生态系统全景、发展历程与应用场景。
- 002 中级 HDFS分布式文件系统 HDFS架构设计、NameNode/DataNode机制、读写流程、容错与高可用方案。
- 003 中级 MapReduce MapReduce编程模型、Shuffle机制、Combiner优化、数据流与性能调优。
- 004 中级 Spark核心 Spark核心概念:RDD、DataFrame、Spark SQL原理与实战。
- 005 中级 Spark-Streaming Spark Streaming流处理原理、DStream、Structured Streaming、窗口操作与Exactly-Once语义。
- 006 中级 Hive数据仓库 Hive架构、HQL语法、分区与桶、UDF开发、性能优化。
- 007 进阶 HBase列族数据库 HBase架构原理、Region管理、RowKey设计、读写流程与性能优化。
- 008 中级 Kafka消息队列 Kafka架构设计、Producer/Consumer模型、分区策略、Offset管理与Exactly-Once语义。
- 009 进阶 Flink流处理 Flink流处理架构、窗口机制、水位线、状态管理、Checkpoint与Exactly-Once保证。
- 010 进阶 数据湖 数据湖架构、Iceberg/Delta Lake/Hudi三大框架对比、ACID事务、时间旅行与Schema演进。
- 011 中级 Zookeeper协调服务 ZooKeeper架构、ZAB协议、Watcher机制、Leader选举与分布式协调应用。
- 012 中级 YARN资源管理 YARN架构设计、ResourceManager/NodeManager机制、调度器对比、容器与队列管理。