Hive存储优化策略

本文介绍了如何优化Hive存储,包括避免小文件生成的策略,如通过设置 CombineHiveInputFormat 合并小文件;详细讲解了ORC文件索引的Row Group Index和Bloom Filter Index,及其对查询性能的提升;以及介绍了ORC矢量化查询的概念,以提高查询效率。这些优化措施对于大数据处理和分析至关重要。

目录

1 避免小文件生成

2 ORC文件索引

2.1 Row Group Index

2.2 Bloom Filter Index

3 ORC矢量化查询

4 总结


1 避免小文件生成

Hive的存储本质还是HDFS,HDFS是不利于小文件存储的,因为每个小文件会产生一条元数据信息,并且不利用MapReduce的处理,MapReduce中每个小文件会启动一个MapTask计算处理,导致资源的浪费,所以在使用Hive进行处理分析时,要尽量避免小文件的生成。

那么在使用Hive时,如何能避免小文件的生成呢?当我们使用多个Reduce进行聚合计算时,我们并不清楚每个Reduce最终会生成的结果的数据大小,无法控制用几个Reduce来处理。Hive中为我们提供了一个特殊的机制,可以自动的判断是否是小文件,如果是小文件可以自动将小文件进行合并。

  • 配置

-- 如果hive的程序,只有maptask,将MapTask产生的所有小文件

评论 6
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值