2023 年 1月 15 日随笔档案 - 牛牛牛牛牛牛牛牛

2023年1月15日

摘要： Spark是一种快速、通用、可扩展的大数据分析引擎，2009年诞生，2010年开源，2013年成为Apache孵化项目，2014年成为Apache顶级项目。目前，Spark生态系统已经发展成为一个包含多个子项目的集合，其中包含SparkSQL、Spark Streaming、GraphX、MLlib等子项目，Spark是基于内存计算的大数据并行计算框架。Spark基于内存计算，提高了在大数据环境下数据处理的实时性，同时保证了高容错性和高可伸缩性，允许用户将Spark部署在大量廉价硬件之上，形成集群。PySpark 是 Spark 为 Python 开发者提供的 API 阅读全文

posted @ 2023-01-15 23:20 牛牛牛牛牛牛牛牛阅读(66) 评论(0) 推荐(0) 编辑

木早长泉

公告