Loading...
Spark SQL 与 Catalyst:从 SQL 文本到物理算子树
容错机制:Lineage、Checkpoint 与推测执行
存储体系:Block Manager、广播变量与累加器
内存管理与 Tungsten:堆外内存、序列化与代码生成
Shuffle 机制:数据跨分区交换的代价与优化
DAG Scheduler 与 Task Scheduler:从逻辑计划到物理执行
宽依赖与窄依赖:Stage 是怎样划分出来的
RDD:弹性分布式数据集的五大属性
导读:为什么 Spark 的核心是一张 DAG
从规则到统计:人工智能七十年的两条路线之争