一、Spark核心特性
Spark是新一代大数据计算引擎,基于内存计算大幅提升处理速度。RDD弹性分布式数据集是核心抽象,DataFrame与Dataset提供高级API。Spark生态覆盖批处理、流处理、机器学习与图计算。
一)Spark架构
Driver负责任务调度,Executor执行计算任务,Cluster Manager管理集群资源。SparkContext连接集群,DAG调度器优化执行计划。内存管理决定性能,持久化策略减少重算。
二)Spark应用场景
Spark SQL处理结构化数据,Spark Streaming实现实时流处理,MLlib提供机器学习算法,GraphX处理图数据。Spark与Hadoop生态协同,读取HDFS数据,替代MapReduce提升性能。实时数仓常用Spark Structured Streaming。
二、Spark实践要点
数据倾斜是常见性能问题,广播变量与分区优化解决。调优参数如executor内存与并行度影响执行效率。Spark学习从Scala或Python API入手,理解RDD转换与行动操作。