Loading...
数据源 API 与谓词下推:让存储层帮忙过滤
Adaptive Query Execution:运行时改写执行计划
DataFrame 与 Dataset:类型安全与性能的折中
Spark SQL 与 Catalyst:从 SQL 文本到物理算子树
容错机制:Lineage、Checkpoint 与推测执行
存储体系:Block Manager、广播变量与累加器
内存管理与 Tungsten:堆外内存、序列化与代码生成
Shuffle 机制:数据跨分区交换的代价与优化
DAG Scheduler 与 Task Scheduler:从逻辑计划到物理执行
宽依赖与窄依赖:Stage 是怎样划分出来的