深度学习部署实战:CMake工程化+YOLOv5行人检测(TensorRT加速+INT8量化)全流程优化指南8

本节内容需要你先学会前面章节,知道怎么进行tensorRT部署。然后本节主要学习的内容是int8量化、fp16量化,并且对cpu推理、cuda推理、tensorRt部署、tensorRT部署int8量化多种方式比较速度。
cpu–》93fps
cuda–》147fps
tensorrt—》166fps
tensorRT+int8量化—》220fps
在这里插入图片描述

同样不想看原理的可以直接跳转到实战部分先运行一遍再来看原理

原理介绍:
首先需要确保你的GPU支持INT8计算(如jetson nano不支持INT8)

1、INT8、FP16量化对比

1.1 简介

深度学习量化就是将深度学习模型中的参数(例如权重和偏置)从浮点数转换成整数或者定点数的过程。这样做可以减少模型的存储和计算成本,从而达到模型压缩和运算加速的目的。如int8量化,让原来模型中32bit存储的数字映射到8bit再计算(范围是[-128,127])。

加快推理速度:访问一次32位浮点型可以访问4次int8整型数据;
减少存储空间和内存占用:在边缘设备(如嵌入式)上部署更实用。
当然,提升速度的同时,量化也会带来精度的损失,为了能尽可能减少量化过程中精度的损失,需要使用各种校准方法来降低信息的损失。TensorRT 中支持两种 INT8 校准算法:

熵校准

评论 5
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

YOLO君

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值