大数据处理框架 Spark 入门
Spark 简介
Apache Spark 是一个快速、通用的大数据处理引擎。
RDD 基础
from pyspark import SparkContext
sc = SparkContext("local", "First App")
data = [1, 2, 3, 4, 5]
rdd = sc.parallelize(data)
result = rdd.map(lambda x: x * 2).collect()
print(result)
DataFrame API
DataFrame 提供了更高级的抽象。