FANDEX-Index
大数据
返回首页
  • 大数据概述
  • HDFS分布式文件系统
  • MapReduce
  • Spark核心
  • Spark-Streaming
  • Hive数据仓库
  • HBase列族数据库
  • Kafka消息队列
  • Flink流处理
  • 数据湖
  • Zookeeper协调服务
  • YARN资源管理
术语表
知识地图
大数据
全部模块
  • 入门指南
  • Markdown
  • Git
  • GitHub
  • HTML5
  • CSS
  • SVG
  • JavaScript
  • TypeScript
  • Vue 3
  • React
  • C
  • C++
  • Java
  • Kotlin
  • C#
  • Python
  • Go
  • Lua
  • HarmonyOS
  • SQL
  • MySQL
  • PostgreSQL
  • Redis
  • 算法与数据结构
  • 计算机基础
  • 高等数学
  • 离散数学
  • 线性代数
  • 概率论与数理统计
  • 英语
  • 运维
  • Networking
  • 网络安全
  • 云计算
  • 物联网
  • 软件测试
  • AI Agent
  • 软件工程
  • 软件架构
  • 工程实践
  • 数据分析
  • 大数据
  • 机器学习
  • 深度学习
  • AI工程
  • 计算机视觉
  • 自然语言处理
  • 大语言模型
  • 生成式AI
  • 多模态AI
  • AI伦理与安全
首页/大数据

大数据

HDFS·Spark·Kafka·Flink

  • 001入门大数据概述大数据概念、5V特征、技术生态系统全景、发展历程与应用场景。
  • 002中级HDFS分布式文件系统HDFS架构设计、NameNode/DataNode机制、读写流程、容错与高可用方案。
  • 003中级MapReduceMapReduce编程模型、Shuffle机制、Combiner优化、数据流与性能调优。
  • 004中级Spark核心Spark核心概念:RDD、DataFrame、Spark SQL原理与实战。
  • 005中级Spark-StreamingSpark Streaming流处理原理、DStream、Structured Streaming、窗口操作与Exactly-Once语义。
  • 006中级Hive数据仓库Hive架构、HQL语法、分区与桶、UDF开发、性能优化。
  • 007进阶HBase列族数据库HBase架构原理、Region管理、RowKey设计、读写流程与性能优化。
  • 008中级Kafka消息队列Kafka架构设计、Producer/Consumer模型、分区策略、Offset管理与Exactly-Once语义。
  • 009进阶Flink流处理Flink流处理架构、窗口机制、水位线、状态管理、Checkpoint与Exactly-Once保证。
  • 010进阶数据湖数据湖架构、Iceberg/Delta Lake/Hudi三大框架对比、ACID事务、时间旅行与Schema演进。
  • 011中级Zookeeper协调服务ZooKeeper架构、ZAB协议、Watcher机制、Leader选举与分布式协调应用。
  • 012中级YARN资源管理YARN架构设计、ResourceManager/NodeManager机制、调度器对比、容器与队列管理。
首页