Hadoop开启了大数据时代,分布式文件系统与计算框架构成海量数据的处理底座,理解核心组件是入门的关键。
一、HDFS分布式文件系统
HDFS将大文件分块存储在多台机器上,namenode管理元数据、datanode存储数据块,实现海量数据可靠存储。
一)数据块的存储机制
文件默认按128MB分块,每块多副本冗余存储,节点故障自动恢复,数据可靠性高。
二)读写流程的理解
客户端与namenode交互获取数据位置,与datanode并行读写,理解流程才能优化性能。
二、MapReduce计算模型
MapReduce将计算拆分为映射与归约阶段,适合离线批处理,简单可靠但延迟较高。
一)Map与Reduce原理
Map阶段并行处理输入分片,Shuffle阶段数据排序分组,Reduce阶段汇总输出结果。
二)YARN资源调度
YARN统一管理集群资源,调度容器运行任务,多计算框架共享集群资源。
三、Hadoop生态的扩展
Hive提供SQL接口、HBase提供列式存储,Spark与Flink补充实时能力,生态协同处理复杂场景。
Hadoop生态是理解大数据技术的基石,从HDFS与MapReduce学起,再拓展生态组件,体系化构建数据能力。