随笔档案「2021年5月」 - 碎觉觉

09 spark连接mysql数据库

摘要：spark连接mysql数据库安装启动检查Mysql服务。netstat -tunlp (3306) spark 连接mysql驱动程序。–cp /usr/local/hive/lib/mysql-connector-java-5.1.40-bin.jar /usr/local/spark/jar 阅读全文

posted @ 2021-05-30 23:03 碎觉觉阅读(115) 评论(0) 推荐(0)

08 学生课程分数的Spark SQL分析

摘要：读学生课程分数文件chapter4-data01.txt，创建DataFrame。用DataFrame的操作或SQL语句完成以下数据分析要求，并和用RDD操作的实现进行对比：每个分数+5分。总共有多少学生？总共开设了哪些课程？每个学生选修了多少门课？每门课程有多少个学生选？每门课程大于阅读全文

posted @ 2021-05-24 00:44 碎觉觉阅读(95) 评论(0) 推荐(0)

08 学生课程分数的Spark SQL分析

摘要：读学生课程分数文件chapter4-data01.txt，创建DataFrame。 1.生成“表头” 2.生成“表中的记录” 3.把“表头”和“表中的记录”拼装在一起用DataFrame的操作或SQL语句完成以下数据分析要求，并和用RDD操作的实现进行对比：每个分数+5分。总共有多少学生？总阅读全文

posted @ 2021-05-19 23:22 碎觉觉阅读(91) 评论(0) 推荐(0)

07 从RDD创建DataFrame

摘要：0.前次作业：从文件创建DataFrame 1.pandas df 与 spark df的相互转换 df_s=spark.createDataFrame(df_p) df_p=df_s.toPandas() >>> import pandas as pd>>> import numpy as np> 阅读全文

posted @ 2021-05-13 23:44 碎觉觉阅读(135) 评论(0) 推荐(0)

06 Spark SQL 及其DataFrame的基本操作

摘要：Spark SQL DataFrame的基本操作文件路径： file='url' 文本： json：创建： spark.read.text(file) spark.read.json(file) 打印数据 df.show()默认打印前20条数据，df.show(n) 文本： json: 打印概要阅读全文

posted @ 2021-05-09 19:30 碎觉觉阅读(124) 评论(0) 推荐(0)

碎觉觉

05 2021 档案

公告