压缩

1 MR支持的压缩编码

压缩格式	工具	算法	文件扩展名	是否可切分
DEFAULT	无	DEFAULT	.deflate	否
Gzip	gzip	DEFAULT	.gz	否
bzip2	bzip2	bzip2	.bz2	是
LZO	lzop	LZO	.lzo	否
LZ4	无	LZ4	.lz4	否
Snappy	无	Snappy	.snappy	否

为了支持多种压缩/解压缩算法，Hadoop引入了编码/解码器，如下表所示：

压缩格式	对应的编码/解码器
DEFLATE	org.apache.hadoop.io.compress.DefaultCodec
gzip	org.apache.hadoop.io.compress.GzipCodec
bzip2	org.apache.hadoop.io.compress.BZip2Codec
LZO	com.hadoop.compression.lzo.LzopCodec
LZ4	org.apache.hadoop.io.compress.Lz4Codec
Snappy	org.apache.hadoop.io.compress.SnappyCodec

压缩性能的比较

压缩算法	原始文件大小	压缩文件大小	压缩速度	解压速度
gzip	8.3GB	1.8GB	17.5MB/s	58MB/s
bzip2	8.3GB	1.1GB	2.4MB/s	9.5MB/s
LZO	8.3GB	2.9GB	49.3MB/s	74.6MB/s

http://google.github.io/snappy/

On a single core of a Core i7 processor in 64-bit mode, Snappy compresses at about 250 MB/sec or more and decompresses at about 500 MB/sec or more.

#查看hadoop支持的压缩算法
hadoop  checknative

在这里插入图片描述

2 压缩参数

参数	默认值	阶段	建议
io.compression.codecs
（在core-site.xml中配置）	org.apache.hadoop.io.compress.DefaultCodec, org.apache.hadoop.io.compress.GzipCodec, org.apache.hadoop.io.compress.BZip2Codec,
org.apache.hadoop.io.compress.Lz4Codec	输入压缩	Hadoop使用文件扩展名判断是否支持某种编解码器
mapreduce.map.output.compress	false	mapper输出	这个参数设为true启用压缩
mapreduce.map.output.compress.codec	org.apache.hadoop.io.compress.DefaultCodec	mapper输出	使用LZO、LZ4或snappy编解码器在此阶段压缩数据
mapreduce.output.fileoutputformat.compress	false	reducer输出	这个参数设为true启用压缩
mapreduce.output.fileoutputformat.compress.codec	org.apache.hadoop.io.compress. DefaultCodec	reducer输出	使用标准工具或者编解码器，如gzip和bzip2
mapreduce.output.fileoutputformat.compress.type	RECORD	reducer输出	SequenceFile输出使用的压缩类型：NONE和BLOCK

#修改mapred-site.xml
mapreduce.map.output.compresstrue

mapreduce.map.output.compress.codecorg.apache.hadoop.io.compress.SnappyCodec


mapreduce.output.fileoutputformat.compresstrue

mapreduce.output.fileoutputformat.compress.codecorg.apache.hadoop.io.compress.SnappyCodec


mapreduce.output.fileoutputformat.compress.typeBLOCK

3 测试MR压缩

#创建目录
hadoop fs -mkdir /wc
#上传小文件
hadoop fs -put ./word.txt  /wc#执行wordcount
hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.3.jar wordcount /wc/word.txt  /wc/1#查看
hadoop fs -D io.compression.codec.snappy.native=true -text /wc/1/part-r-00000.snappy  |head -10

在这里插入图片描述

5 修改hive配置文件


vim hive-site.xml
hive.exec.compress.outputtrue

mapreduce.map.output.compress.codecorg.apache.hadoop.io.compress.SnappyCodec


mapreduce.output.fileoutputformat.compresstrue

mapreduce.output.fileoutputformat.compress.codecorg.apache.hadoop.io.compress.SnappyCodec


mapreduce.output.fileoutputformat.compress.typeBLOCK

6 重启hive，创建表，加载数据

CREATE TABLE t_test(
cookieid string,
createtime string, 
pv INT
) ROW FORMAT DELIMITED FIELDS TERMINATED BY ',';load data local inpath '/usr/local/rosh/data/test.txt' into table t_test;

7 执行sql

insert overwrite local directory '/usr/local/rosh/compress' select * from t_test distribute by cookieid sort by pv desc;

在这里插入图片描述

词库加载错误:未能找到文件“E:\highferrum_mysql\Configuration\Dict_Stopwords.txt”。

上一篇：每日学术速递3.15

下一篇：软考：常见小题目计算题

Hive 压缩配置详解

压缩

1 MR支持的压缩编码

2 压缩参数

3 测试MR压缩

5 修改hive配置文件

6 重启hive，创建表，加载数据

7 执行sql

相关内容

热门资讯