本节内容需要你先学会前面章节,知道怎么进行tensorRT部署。然后本节主要学习的内容是int8量化、fp16量化,并且对cpu推理、cuda推理、tensorRt部署、tensorRT部署int8量化多种方式比较速度。
cpu–》93fps
cuda–》147fps
tensorrt—》166fps
tensorRT+int8量化—》220fps

同样不想看原理的可以直接跳转到实战部分先运行一遍再来看原理
原理介绍:
首先需要确保你的GPU支持INT8计算(如jetson nano不支持INT8)
1、INT8、FP16量化对比
1.1 简介
深度学习量化就是将深度学习模型中的参数(例如权重和偏置)从浮点数转换成整数或者定点数的过程。这样做可以减少模型的存储和计算成本,从而达到模型压缩和运算加速的目的。如int8量化,让原来模型中32bit存储的数字映射到8bit再计算(范围是[-128,127])。
加快推理速度:访问一次32位浮点型可以访问4次int8整型数据;
减少存储空间和内存占用:在边缘设备(如嵌入式)上部署更实用。
当然,提升速度的同时,量化也会带来精度的损失,为了能尽可能减少量化过程中精度的损失,需要使用各种校准方法来降低信息的损失。TensorRT 中支持两种 INT8 校准算法:
熵校准

订阅专栏 解锁全文
8909

被折叠的 条评论
为什么被折叠?



