上一页 1 ··· 6 7 8 9 10 11 12 13 14 ··· 24 下一页
摘要: 一、Hive 执行过程概述 1、概述 (1) Hive 将 HQL 转换成一组操作符(Operator),比如 GroupByOperator, JoinOperator 等 (2)操作符 Operator 是 Hive 的最小处理单元 (3)每个操作符代表一个 HDFS 操作或者 MapReduc 阅读全文
posted @ 2018-04-15 15:44 扎心了,老铁 阅读(11497) 评论(2) 推荐(5) 编辑
摘要: 1、什么是数据倾斜? 由于数据分布不均匀,造成数据大量的集中到一点,造成数据热点 2、Hadoop 框架的特性 A、不怕数据大,怕数据倾斜 B、Jobs 数比较多的作业运行效率相对比较低,如子查询比较多 C、 sum,count,max,min 等聚集函数,通常不会有数据倾斜问题 3、主要表现 任务 阅读全文
posted @ 2018-04-15 15:41 扎心了,老铁 阅读(33331) 评论(2) 推荐(4) 编辑
摘要: 一、Hive的命令行 1、Hive支持的一些命令 Command Description quit Use quit or exit to leave the interactive shell. set key=value Use this to set value of particular c 阅读全文
posted @ 2018-04-15 15:40 扎心了,老铁 阅读(15157) 评论(0) 推荐(0) 编辑
摘要: 概述 GROUPING SETS,GROUPING__ID,CUBE,ROLLUP 这几个分析函数通常用于OLAP中,不能累加,而且需要根据不同维度上钻和下钻的指标统计,比如,分小时、天、月的UV数。 数据准备 数据格式 创建表 玩一玩GROUPING SETS和GROUPING__ID 说明 在一 阅读全文
posted @ 2018-04-15 15:37 扎心了,老铁 阅读(15242) 评论(1) 推荐(4) 编辑
摘要: 数据准备 数据格式 cookie4.txt 创建表 玩一玩LAG 说明 LAG(col,n,DEFAULT) 用于统计窗口内往上第n行值 第一个参数为列名,第二个参数为往上第n行(可选,默认为1),第三个参数为默认值(当往上第n行为NULL时候,取默认值,如不指定,则为NULL) 查询语句 查询结果 阅读全文
posted @ 2018-04-15 15:33 扎心了,老铁 阅读(33936) 评论(1) 推荐(5) 编辑
摘要: 这两个序列分析函数不是很常用,这里也练习一下。 数据准备 数据格式 cookie3.txt 创建表 玩一玩CUME_DIST 说明 –CUME_DIST :小于等于当前值的行数/分组内总行数 查询语句 比如,统计小于等于当前薪水的人数,所占总人数的比例 查询结果 结果说明 玩一玩PERCENT_RA 阅读全文
posted @ 2018-04-11 20:13 扎心了,老铁 阅读(10817) 评论(0) 推荐(0) 编辑
摘要: 概述 本文中介绍前几个序列函数,NTILE,ROW_NUMBER,RANK,DENSE_RANK,下面会一一解释各自的用途。 注意: 序列函数不支持WINDOW子句。(ROWS BETWEEN) 数据准备 数据格式 创建表 玩一玩NTILE 说明 NTILE(n),用于将分组数据按照顺序切分成n片, 阅读全文
posted @ 2018-04-11 19:43 扎心了,老铁 阅读(11377) 评论(0) 推荐(1) 编辑
摘要: 数据准备 数据格式 创建数据库及表 玩一玩SUM 查询语句 查询结果 说明 如果不指定ROWS BETWEEN,默认为从起点到当前行;如果不指定ORDER BY,则将分组内所有值累加;关键是理解ROWS BETWEEN含义,也叫做WINDOW子句:PRECEDING:往前FOLLOWING:往后CU 阅读全文
posted @ 2018-04-10 21:43 扎心了,老铁 阅读(25972) 评论(1) 推荐(1) 编辑
摘要: 案例说明 现有如此三份数据:1、users.dat 数据格式为: 2::M::56::16::70072, 共有6040条数据对应字段为:UserID BigInt, Gender String, Age Int, Occupation String, Zipcode String对应字段中文解释: 阅读全文
posted @ 2018-04-10 21:41 扎心了,老铁 阅读(23156) 评论(10) 推荐(6) 编辑
摘要: 一、求单月访问次数和总访问次数 1、数据说明 数据字段说明 数据格式 2、数据准备 (1)创建表 (2)导入数据 (3)验证数据 3、结果需求 现要求出:每个用户截止到每月为止的最大单月访问次数和累计到该月的总访问次数,结果数据格式如下 4、需求分析 此结果需要根据用户+月份进行分组 (1)先求出当 阅读全文
posted @ 2018-04-10 21:40 扎心了,老铁 阅读(49292) 评论(18) 推荐(11) 编辑
上一页 1 ··· 6 7 8 9 10 11 12 13 14 ··· 24 下一页