Hadoop - MapRedcue支持的压缩编码、压缩方式选择、压缩位置选择及参数配置

一、为什么要使用压缩？

压缩技术能够有效减少底层存储系统（HDFS）读写字节数。压缩提高了网络带宽和磁盘空间的效率。在运行MR程序时，I/O操作、网络数据传输、 Shuffle和Merge要花大量的时间，尤其是数据规模很大和工作负载密集的情况下，因此，使用数据压缩显得非常重要。

鉴于磁盘I/O和网络带宽是Hadoop的宝贵资源，数据压缩对于节省资源、最小化磁盘I/O和网络传输非常有帮助。可以在任意MapReduce阶段启用压缩。不过，尽管压缩与解压操作的CPU开销不高，其性能的提升和资源的节省并非没有代价。【会玩才能提升性能】

二、压缩的策略和原则

压缩是提高Hadoop运行效率的一种优化策略。

通过对Mapper、Reducer运行过程的数据进行压缩，以减少磁盘IO，提高MR程序运行速度。

注意：采用压缩技术减少了磁盘IO，但同时增加了CPU运算负担。所以，压缩特性运用得当能提高性能，但运用不当也可能降低性能。【压缩就是编码与解码的过程，内置压缩算法，当然会消耗CPU资源】

压缩基本原则：

（1）运算密集型的job，少用压缩

（2）IO密集型的job，多用压缩

三、MR支持的压缩编码

压缩格式	hadoop自带？	算法	文件扩展名	是否可切片	换成压缩格式后，原来的程序是否需要修改
DEFLATE	是，直接使用	DEFLATE	.deflate	否	和文本处理一样，不需要修改
Gzip	是，直接使用	DEFLATE	.gz	否	和文本处理一样，不需要修改
bzip2	是，直接使用	bzip2	.bz2	是	和文本处理一样，不需要修改
LZO	否，需要安装	LZO	.lzo	是	需要建索引，还需要指定输入格式
Snappy	是，直接使用	Snappy	.snappy	否	和文本处理一样，不需要修改

为了支持多种压缩/解压缩算法，Hadoop引入了编码/解码器，如下表所示。

压缩格式	对应的编码/解码器
DEFLATE	org.apache.hadoop.io.compress.DefaultCodec
gzip	org.apache.hadoop.io.compress.GzipCodec
bzip2	org.apache.hadoop.io.compress.BZip2Codec
LZO	com.hadoop.compression.lzo.LzopCodec
Snappy	org.apache.hadoop.io.compress.SnappyCodec

压缩性能的比较

压缩算法	原始文件大小	压缩文件大小	压缩速度	解压速度
gzip	8.3GB	1.8GB	17.5MB/s	58MB/s
bzip2	8.3GB	1.1GB	2.4MB/s	9.5MB/s
LZO	8.3GB	2.9GB	49.3MB/s	74.6MB/s

小结：1）Gzip中庸，没有特点；2）Bzip2，慢工出细活，支持切片，压缩率高，但速度慢，合适冷数据；3）LZO，压缩解压缩速度接近于磁盘I/O速度，支持切片，但是使用麻烦；4）Snappy，一个字，就是快，压缩速度250MB/s，解压速度500MB/s，但是不支持切片，故最好压缩后的文件大小100-200MB，就非常适合用Snappy，企业中非常受欢迎，且Hadoop 3.x 配合CensOs7.0默认支持，Hadoop 2.0不支持。如果有一天Snappy支持切片，估计就没有其他压缩格式的活了。