随笔分类 -  spark

摘要:【博学谷IT技术支持】 ## Spark基础 ### spark的特点 * 运行速度快 ```js 提供了一个全新的数据结构哦RDD(弹性的分布式数据集) 整个Spark是基于线程来运行的,线程的启动和销毁优于进程 ``` * 易用性 ```js spark 提供了多种操作语言的API,python 阅读全文
posted @ 2023-05-23 10:39 牛牛牛牛牛牛牛牛 阅读(113) 评论(0) 推荐(0) 编辑
摘要:【博学谷IT技术支持】 Spark 是一款用于大规模数据处理分析式的分布引擎 MR的弊端: 计算效率慢 使用API相对比较低级 迭代计算非常不方便 什么是迭代计算: 在计算过程中,需要将计算划分为N个阶段,每个阶段直接互相依赖,后 一个阶段必须等待前一个阶段执行完成,然后才能执行后一个阶段 Spar 阅读全文
posted @ 2023-02-05 23:01 牛牛牛牛牛牛牛牛 阅读(70) 评论(0) 推荐(0) 编辑
摘要:Spark是一种快速、通用、可扩展的大数据分析引擎,2009年诞生,2010年开源,2013年成为Apache孵化项目,2014年成为Apache顶级项目。目前,Spark生态系统已经发展成为一个包含多个子项目的集合,其中包含SparkSQL、Spark Streaming、GraphX、MLlib等子项目,Spark是基于内存计算的大数据并行计算框架。Spark基于内存计算,提高了在大数据环境下数据处理的实时性,同时保证了高容错性和高可伸缩性,允许用户将Spark部署在大量廉价硬件之上,形成集群。PySpark 是 Spark 为 Python 开发者提供的 API 阅读全文
posted @ 2023-01-15 23:20 牛牛牛牛牛牛牛牛 阅读(87) 评论(0) 推荐(0) 编辑

点击右上角即可分享
微信分享提示