hive中order by,sort by, distribute by, cluster by作用_Hadoop

2条回答

yangzp

2楼 · 2020-07-10 09:16

Order By全局排序

1．使用 ORDER BY 子句排序

ASC（ascend）: 升序（默认）

DESC（descend）: 降序

2．ORDER BY 子句在SELECT语句的结尾

Sort By每个MapReduce内部排序

Sort By：每个MapReduce内部进行排序，会形成多个结果文件，每个结果文件有序，对全局结果集来说不是排序。

需要设置reduce个数

Distribute By分区排序

Sort by排序后的结果文件，无法指定哪些数据进入到同个文件，而分区排序可以，比如部门编号相同的进入到同个结果文件，然后再利用sort by进行排序。

Distribute By：类似MR中partition，进行分区，结合sort by使用。

注意，Hive要求DISTRIBUTE BY语句要写在SORT BY语句之前。

对于distribute by进行测试，一定要分配多reduce进行处理，否则无法看到distribute by的效果。

CLUSTER BY

当distribute by和sorts by字段相同时，可以使用cluster by方式。

cluster by除了具有distribute by的功能外还兼具sort by的功能。但是排序只能是倒序排序，不能指定排序规则为ASC或者DESC，因为相同的值的内容被写到同一个结果里面，无所谓正序倒序了。

我的网名不再改

3楼 · 2020-08-21 13:22

1. order byHive中的order by跟传统的sql语言中的order by作用是一样的，会对查询的结果做一次全局排序，所以说，只有hive的sql中制定了order by所有的数据都会到同一个reducer进行处理（不管有多少map，也不管文件有多少的block只会启动一个reducer）。但是对于大量数据这将会消耗很长的时间去执行。

这里跟传统的sql还有一点区别：如果指定了hive.mapred.mode=strict（默认值是nonstrict）,这时就必须指定limit来限制输出条数，原因是：所有的数据都会在同一个reducer端进行，数据量大的情况下可能不能出结果，那么在这样的严格模式下，必须指定输出的条数。

2. sort by

Hive中指定了sort by，那么在每个reducer端都会做排序，也就是说保证了局部有序（每个reducer出来的数据是有序的，但是不能保证所有的数据是有序的，除非只有一个reducer），好处是：执行了局部排序之后可以为接下去的全局排序提高不少的效率（其实就是做一次归并排序就可以做到全局排序了）。

3. distribute by和sort by一起使用

ditribute by是控制map的输出在reducer是如何划分的，举个例子，我们有一张表，mid是指这个store所属的商户，money是这个商户的盈利，name是这个store的名字

store:

mid	money	name
AA	15.0	商店1
AA	20.0	商店2
BB	22.0	商店3
CC	44.0	商店4

执行hive语句：

[delphi] view plaincopy

select mid, money, name from store distribute by mid sort by mid asc, money asc

我们所有的mid相同的数据会被送到同一个reducer去处理，这就是因为指定了distribute by mid，这样的话就可以统计出每个商户中各个商店盈利的排序了（这个肯定是全局有序的，因为相同的商户会放到同一个reducer去处理）。这里需要注意的是distribute by必须要写在sort by之前。

4. cluster by

cluster by的功能就是distribute by和sort by相结合，如下2个语句是等价的：

[sql] view plaincopy

select mid, money, name from store cluster by mid

[sql] view plaincopy

select mid, money, name from store distribute by mid sort by mid

如果需要获得与3中语句一样的效果：

[sql] view plaincopy

select mid, money, name from store cluster by mid sort by money

注意被cluster by指定的列只能是降序，不能指定asc和desc。

相关问题推荐

【Hadoop】如何在hdfs根目录下创建文件夹 HDFS客户端操作 2020-11-06 18:51

回答 10

创建test文件夹hadoop fs -mkdir /test
【大数据基础】hadoop的三大组件及其作用是什么 Hadoop 2020-12-27 15:27

回答 7

Hadoop的三大核心组件分别是：1、HDFS(Hadoop Distribute File System)：hadoop的数据存储工具。2、YARN(Yet Another Resource Negotiator,另一种资源协调者)：Hadoop 的资源管理器。3、Hadoop MapReduce:分布式计算框架。HDFS是一个高度容错性的系统，适合部...
【hbase基础】hbase依靠什么存储底层数据 HBase 2020-12-12 09:46

回答 18

hbase依靠HDFS来存储底层数据。Hadoop分布式文件系统(HDFS)为HBase提供了高可靠性的底层存储支持，HBase中的所有数据文件都存储在Hadoop HDFS文件系统上。
【大数据基础】hbase数据库特点 HBase 2020-12-27 15:54

回答 24

HBase分布式数据库具有如下的显著特点：容量大：HBase分布式数据库中的表可以存储成千上万的行和列组成的数据。面向列：HBase是面向列的存储和权限控制，并支持独立检索。列存储，其数据在表中是按照某列存储的，根据数据动态的增加列，并且可以单独对列进行...
Hadoop和Spark的相同点和不同点？2021-04-06 19:14

回答 19

解决问题的层面不一样首先，Hadoop和Apache Spark两者都是大数据框架，但是各自存在的目的不尽相同。Hadoop实质上更多是一个分布式数据基础设施: 它将巨大的数据集分派到一个由普通计算机组成的集群中的多个节点进行存储，意味着您不需要购买和维护昂贵的服务...
【大数据基础】hbase和redis的区别是什么 HBase 2020-12-27 15:31

回答 14

1、HBase写快读慢，HBase的读取时长通常是几毫秒，而Redis的读取时长通常是几十微秒。性能相差非常大。2、HBase和Redis都支持KV类型。但是Redis支持List、Set等更丰富的类型。3、Redis支持的数据量通常受内存限制，而HBase没有这个限制，可以存储远超内存大小...
【hbase基础】hbase是列式存储吗 HBase 2020-12-12 09:45

回答 15

列式存储格式是指以列为单位存储数据的数据存储格式，相比于传统的行式存储格式，它具有压缩比高、读I/O少(此处指可避免无意义的读I/O)等优点，目前被广泛应用于各种存储引擎中。对于HBase而言，它并不是一个列式存储引擎，而是列簇式存储引擎，即同一列簇中...
【Hadoop】hadoop分布式是什么 Hadoop 2020-11-06 18:50

回答 14

一、简单理解Hadoop是一个大象：一个hadoop集群主要包含三个主要的模块：Mapreduce,hdfs,yarn。mapreduce是一个分离在合并的计算框架，注意他不是一个集群，而是一个编程框架。hdfs是一个分布式文件系统，是一个分布式集群，用于存放数据。yarn集群是负责集群...
常用的数据采集引擎有哪些？2021-06-28 19:22

回答 12

01 网络公开数据集02 数据报采集03 网络爬虫04 日志收集05 社会调查06 业务数据集07 埋点采集08 传感器采集09 数据交易平台10 个人数据收集
Hadoop环境搭建步骤，注意事项有哪些？2021-06-10 19:09

回答 9

1 Hadoop 各个目录的解释bin：Hadoop管理脚本和使用脚本所在目录， sbin目录下的脚本都是使用此目录下的脚本实现的。etc：Hadoop的所有配置文件所在的目录，所有hadoop的配置在etc/hadoop目录下include:对外提供的库的头文件lib ：对外提供的动态编程库和静态...
hdfs存储机制是怎样的?2021-04-29 20:29

回答 4

HDFS存储机制，包括HDFS的写入过程和读取过程两个部分： 1、写入过程： 1）客户端向namenode请求上传文件，namenode检查目标文件是否已存在，父目录是否存在。2）namenode返回是否可以上传。3）客户端请求第一个 block上传到哪几个datanode服务器上。4）nam...
Shuffle 发生在哪里？2021-04-28 20:11

回答 4

adoop核心：MapReduce原理。 MR的核心是shuffle，被称为奇迹发生的地方。 shuffle，弄乱，洗牌的意思。partition 分区，sort 排序，spill溢出，disk 磁盘下面是官方对shuffle的配图： phase 阶段，fetch 最终，merge 合并...
Hadoop 的shuffle 会进行几次排序？2021-04-28 20:10

回答 2

Shuffle阶段分为两部分:Map端和Reduce端。一 map端shuffle过程；1-内存预排序：默认每个map有100M内存进行预排序（为了效率），超过阈值，会把内容写到磁盘；此过程使用快速排序算法；2-根据key和reducer的数量进行分区和排序；首先根据数据所属的Parti...
为什么Hadoop可用于大数据分析？2021-04-28 19:57

回答 3

大数据时代需要1存储大量数据2快速的处理大量数据3从大量数据中进行分析
Hadoop有哪几种模式？2021-04-27 20:20

回答 3

hadoop的四种模式。1、本地模式：本地模式就是解压源码包，不需要做任何的配置。通常用于开发调试，或者感受hadoop。2、伪分布模式：在学习当中一般都是使用这种模式，伪分布模式就是在一台机器的多个进程运行多个模块。虽然每一个模块都有相应的进程，但是却...
hadoop如何进入编辑文件模式以及退出输入模式？2021-04-27 20:15

回答 1

进入和退出安全模式 [root@localhost bin]# ./hdfs dfsadmin -safemode enter15/08/03 07:26:24 WARN util.NativeCodeLoader: Unable to load native-hadoop library for your platform... using builtin-java classes where ......

没有解决我的问题，去提问