随笔档案「2021年3月」 - 小王子C

RDD编程练习

摘要：一、filter,map,flatmap练习： 1.读文本文件生成RDD lines lines=sc.textFile("file:///home/hadoop/word.txt") #读取本地文件 lines.collect() 2.将一行一行的文本分割成单词 words words=lines 阅读全文

posted @ 2021-03-30 19:31 小王子C 阅读(88) 评论(0) 推荐(0)

Spark RDD编程

摘要：1. 准备文本文件从文件创建RDD lines=sc.textFile()筛选出含某个单词的行 lines.filter()lambda 参数：条件表达式 >>>lines=sc.textFile("file:///home/hadoop/word.txt") >>>lines.foreach(pr 阅读全文

posted @ 2021-03-26 17:12 小王子C 阅读(89) 评论(0) 推荐(0)

Spark架构与运行流程

摘要：1. 阐述Hadoop生态系统中，HDFS, MapReduce, Yarn, Hbase及Spark的相互关系。 2. Spark已打造出结构一体化、功能多样化的大数据生态系统，请简述Spark生态系统。 3. 用图文描述你所理解的Spark运行架构，运行流程。 4. 软件平台准备：Linux-H 阅读全文

posted @ 2021-03-12 15:17 小王子C 阅读(137) 评论(0) 推荐(0)

小王子C

03 2021 档案

公告