7、Spark SQL

1.请分析SparkSQL出现的原因，并简述SparkSQL的起源与发展。

spark产生：为了替代Mapreduce，解决Mapreduce计算短板

随着Spark的发展，Shark对于Hive的太多依赖（如采用Hive的语法解析器、查询优化器等等），制约了Spark的One Stack Rule Them All的既定方针，制约了Spark各个组件的相互集成，所以提出了SparkSQL项目。SparkSQL抛弃原有Shark的代码，汲取了Shark的一些优点，如内存列存储（In-Memory Columnar Storage）、Hive兼容性等，重新开发了SparkSQL代码；由于摆脱了对Hive的依赖性，SparkSQL无论在数据兼容、性能优化、组件扩展方面都得到了极大的方便。

2. 简述RDD 和DataFrame的联系与区别？

在Spark中，DataFrame是一种以RDD为基础的分布式数据集，因此DataFrame可以完成RDD的绝大多数功能，在开发使用时，也可以调用方法将RDD和DataFrame进行相互转换。DataFrame的结构类似于传统数据库的二维表格，并且可以从很多数据源中创建，例如结构化文件、外部数据库、Hive表等数据源。

总的来说，DataFrame除了提供比RDD更丰富的算子以外，更重要的特点是提升Spark框架执行效率、减少数据读取时间以及优化执行计划。有了DataFrame这个更高层次的抽象后，处理数据就更加简单了，甚至可以直接用SQL来处理数据，这对于开发者来说，易用性有了很大的提升。不仅如此，通过DataFrame API或SQL处理数据，Spark 优化器（Catalyst）会自动优化，即使我们写的程序或SQL不高效，程序也可以高效的执行。

3.DataFrame的创建

spark.read.text(url)