【Spark】概述
大数据数据处理模型:
1.Google的MapReduce是一个简单通用和自动容错的批处理计算模型。但,不适合交互式和流式计算!
2.Storm
3.Impala
4.GraphLab
5.Spark
Spark: 伯克利大学提出, RDD概念(一种新的抽象的弹性数据集),MapReduce的一种扩展。
RDD本质:在并行计算的各个阶段进行有效的数据共享。
Spark兼容hadoop,使用Scala语言编写,支持Java和Python接口。可实现图计算,交互查询,流计算,批处理。