torch.backends.cudnn.benchmark和torch.use_deterministic_algorithms总结学习记录

本文主要是介绍torch.backends.cudnn.benchmark和torch.use_deterministic_algorithms总结学习记录,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

经常使用PyTorch框架的应该对于torch.backends.cudnn.benchmark和torch.use_deterministic_algorithms这两个语句并不陌生,在以往开发项目的时候可能专门化花时间去了解过,也可能只是浅尝辄止简单有关注过,正好今天再次遇到了就想着总结梳理一下。

torch.backends.cudnn.benchmark 是 PyTorch 中的一个设置选项,用于优化卷积神经网络(CNN)的计算效率。这个选项可以显著加速卷积操作,尤其是在使用 NVIDIA cuDNN 库时。

背景简介

卷积层是卷积神经网络中的最重要的部分,也往往是运算量最大的部分。对于卷积这个操作来说,其实现方式是多种多样的。最简单的实现方式就是使用多层循环嵌套,对于每张输入图像,对于每个要输出的通道,对于每个输入的通道,选取一个区域,同指定卷积核进行卷积操作,然后逐行滑动,直到整张图像都处理完毕,这个方法一般被称为 direct 法,这个方法虽然简单,但是看到这么多循环,我们就知道效率在一般情况下不会很高了。除此之外,实现卷积层的算法还有基于 GEMM (General Matrix Multiply) 的,基于 FFT 的,基于 Winograd 算法的等等,每种卷积算法,都有其特有的一些优势,比如有的算法在卷积核大的情况下,速度很快;比如有的算法在某些情况下内存使用比较小。给定一个卷积神经网络(比如 ResNet-101),给定输入图片的尺寸,给定硬件平台,实现这个网络最简单的方法就是对所有卷积层都采用相同的卷积算法(比如 direct 算法),但是这样运行肯定不是最优的;比较好的方法是,我们可以预先进行一些简单的优化测试,在每一个卷积层中选择最适合(最快)它的卷积算法,决定好每层最快的算法之后,我们再运行整个网络,这样效率就会提升不少。

这里有一个问题,为什么我们可以提前选择每层的算法,即使每次我们送入网络训练的图片是不一样的?即每次网络的输入都是变化的,那么我怎么确保提前选出来的最优算法同样也适用于这个输入呢?原因就是,对于给定输入来说,其具体值的大小是不影响卷积的运行时间的,只有其尺寸才会影响。举例来说,我们只要固定输入大小都是 (8, 64, 224, 224),即 batch_size 为 8,输入的通道为 64,宽和高为 224,那么卷积层的运行时间都是几乎不变的,无论其中每个像素具体的值是 0.1 还是 1000。这样的话,因为我们固定了模型输入的尺寸大小,所以对每个卷积层来说,其接受的输入尺寸都是静态的,固定不变的,在提前做优化的时候我们只要使用随机初始化的相应尺寸的输入进行测试和选择就行了。

1. 什么是 cuDNN?

cuDNN 是 NVIDIA CUDA 深度神经网络库(CUDA Deep Neural Network library)的缩写。它是一个高度优化的库,专门用于加速深度学习中的卷积操作。cuDNN 提供了许多高效的算法,可以自动选择最适合当前硬件和输入尺寸的算法。

2. torch.backends.cudnn.benchmark 的作用

torch.backends.cudnn.benchmark 是一个布尔值选项,默认情况下为 False。当设置为 True 时,cuDNN 会启用自动搜索和选择最优算法的机制。具体来说:

  • 自动搜索最优算法: cuDNN 会根据输入的尺寸和网络结构,自动搜索并选择最优的卷积算法。这个过程可能需要一些时间,但一旦找到最优算法,后续的卷积操作会显著加速。

  • 适合固定输入尺寸: 这个选项最适合在输入尺寸固定的情况下使用。如果输入尺寸经常变化,cuDNN 每次都需要重新搜索最优算法,这可能会导致性能下降。

3. 如何使用 torch.backends.cudnn.benchmark

你可以在代码中设置 torch.backends.cudnn.benchmark 为 True,如下所示:

import torch# 启用 cuDNN 自动搜索最优算法
if torch.cuda.is_available():device = torch.device('cuda')print('Using GPU: ', torch.cuda.get_device_name(0))if args.use_benchmark:torch.backends.cudnn.benchmark = Trueprint('Using cudnn.benchmark.')
else:device = torch.device('cpu')print('Warning! Using CPU.')# 你的模型和训练代码
model = YourModel()
model.to('cuda')
# ...

4. 优缺点

  • 优点:

    • 加速卷积操作: 通过自动选择最优算法,可以显著加速卷积操作,尤其是在大规模模型和数据集上。

    • 简化代码: 不需要手动选择和调整卷积算法,cuDNN 会自动处理。

  • 缺点:

    • 初始化时间增加: 在第一次运行时,cuDNN 需要搜索最优算法,这可能会增加初始化时间。

    • 不适合动态输入尺寸: 如果输入尺寸经常变化,cuDNN 每次都需要重新搜索最优算法,这可能会导致性能下降。

5. 适用场景

  • 固定输入尺寸: 如果你的输入尺寸是固定的(例如图像分类任务中的固定尺寸图像),启用 torch.backends.cudnn.benchmark 可以显著提升性能。

  • 大规模模型和数据集: 在大规模模型和数据集上,卷积操作的加速效果尤为明显。

6. 注意事项

  • 动态输入尺寸: 如果你的输入尺寸经常变化(例如在目标检测或生成对抗网络中),建议不要启用 torch.backends.cudnn.benchmark,以免性能下降。

  • 调试和分析: 在调试和分析模型时,建议将 torch.backends.cudnn.benchmark 设置为 False,以确保每次运行的结果一致。

torch.use_deterministic_algorithms(False) 是 PyTorch 中的一个设置选项,用于控制是否使用确定性算法。确定性算法是指在相同的输入和相同的硬件环境下,每次运行都会产生相同的结果。以下是详细介绍:

1. 什么是确定性算法?

确定性算法是指在相同的输入和相同的硬件环境下,每次运行都会产生相同的结果。这种特性在调试和复现实验结果时非常有用,因为它可以确保每次运行的结果都是一致的。

2. torch.use_deterministic_algorithms 的作用

torch.use_deterministic_algorithms 是一个布尔值选项,默认情况下为 False。当设置为 True 时,PyTorch 会尽可能使用确定性算法,以确保每次运行的结果一致。具体来说:

  • 确定性算法: 启用确定性算法后,PyTorch 会使用那些在相同输入下总是产生相同输出的算法。这包括一些随机数生成器、卷积算法等。

  • 性能影响: 使用确定性算法可能会导致性能下降,因为某些确定性算法可能不如非确定性算法高效。

3. 如何使用 torch.use_deterministic_algorithms

你可以在代码中设置 torch.use_deterministic_algorithms 为 True 或 False,如下所示:

import torch# 启用确定性算法
torch.use_deterministic_algorithms(True)# 你的模型和训练代码
model = YourModel()
model.to('cuda')
# ...

我第一次注意到torch.use_deterministic_algorithms的时候是在基于YOLOv5开发自己的目标检测模型的时候, 如下:

在我自己的机器上直接运行的话会报错,需要将其改为如下代码:

torch.use_deterministic_algorithms(False)

我刚才专门又去看了下github里面官方的项目,发现官网最新的代码已经把这句代码删除了,感兴趣的话可以自行看下,如下所示:

4. 优缺点

  • 优点:

    • 结果可复现: 启用确定性算法可以确保每次运行的结果一致,这对于调试和复现实验结果非常有用。

    • 简化调试: 在调试过程中,确定性算法可以帮助你更容易地找到问题的根源,因为每次运行的结果都是相同的。

  • 缺点:

    • 性能下降: 使用确定性算法可能会导致性能下降,因为某些确定性算法可能不如非确定性算法高效。

    • 功能限制: 某些操作可能没有确定性实现,因此在这些情况下,启用确定性算法可能会导致错误或限制某些功能。

5. 适用场景

  • 调试和复现: 在调试和复现实验结果时,启用确定性算法非常有用,因为它可以确保每次运行的结果一致。

  • 敏感应用: 在某些对结果一致性要求非常高的应用中(例如金融、安全等领域),确定性算法可能是一个重要的考虑因素。

6. 注意事项

  • 性能影响: 启用确定性算法可能会导致性能下降,因此在生产环境中,你可能需要权衡性能和结果一致性之间的平衡。

  • 功能限制: 某些操作可能没有确定性实现,因此在启用确定性算法时,需要注意这些限制。

7. 相关设置

  • torch.backends.cudnn.deterministic: 这个选项与 torch.use_deterministic_algorithms 类似,但它主要影响 cuDNN 库的行为。当设置为 True 时,cuDNN 会使用确定性算法。

总结

torch.backends.cudnn.benchmark 是一个强大的工具,可以显著加速卷积神经网络的计算效率。通过启用这个选项,cuDNN 会自动搜索并选择最优的卷积算法,从而提升性能。然而,它最适合在输入尺寸固定的情况下使用,如果输入尺寸经常变化,可能会导致性能下降。torch.use_deterministic_algorithms(False) 是一个用于控制是否使用确定性算法的选项。启用确定性算法可以确保每次运行的结果一致,但在某些情况下可能会导致性能下降。

这篇关于torch.backends.cudnn.benchmark和torch.use_deterministic_algorithms总结学习记录的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1142649

相关文章

Python UV安装、升级、卸载详细步骤记录

《PythonUV安装、升级、卸载详细步骤记录》:本文主要介绍PythonUV安装、升级、卸载的详细步骤,uv是Astral推出的下一代Python包与项目管理器,主打单一可执行文件、极致性能... 目录安装检查升级设置自动补全卸载UV 命令总结 官方文档详见:https://docs.astral.sh/

SQL中JOIN操作的条件使用总结与实践

《SQL中JOIN操作的条件使用总结与实践》在SQL查询中,JOIN操作是多表关联的核心工具,本文将从原理,场景和最佳实践三个方面总结JOIN条件的使用规则,希望可以帮助开发者精准控制查询逻辑... 目录一、ON与WHERE的本质区别二、场景化条件使用规则三、最佳实践建议1.优先使用ON条件2.WHERE用

统一返回JsonResult踩坑的记录

《统一返回JsonResult踩坑的记录》:本文主要介绍统一返回JsonResult踩坑的记录,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录统一返回jsonResult踩坑定义了一个统一返回类在使用时,JsonResult没有get/set方法时响应总结统一返回

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

java对接海康摄像头的完整步骤记录

《java对接海康摄像头的完整步骤记录》在Java中调用海康威视摄像头通常需要使用海康威视提供的SDK,下面这篇文章主要给大家介绍了关于java对接海康摄像头的完整步骤,文中通过代码介绍的非常详细,需... 目录一、开发环境准备二、实现Java调用设备接口(一)加载动态链接库(二)结构体、接口重定义1.类型

Nginx Location映射规则总结归纳与最佳实践

《NginxLocation映射规则总结归纳与最佳实践》Nginx的location指令是配置请求路由的核心机制,其匹配规则直接影响请求的处理流程,下面给大家介绍NginxLocation映射规则... 目录一、Location匹配规则与优先级1. 匹配模式2. 优先级顺序3. 匹配示例二、Proxy_pa

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

apache的commons-pool2原理与使用实践记录

《apache的commons-pool2原理与使用实践记录》ApacheCommonsPool2是一个高效的对象池化框架,通过复用昂贵资源(如数据库连接、线程、网络连接)优化系统性能,这篇文章主... 目录一、核心原理与组件二、使用步骤详解(以数据库连接池为例)三、高级配置与优化四、典型应用场景五、注意事

SpringBoot实现文件记录日志及日志文件自动归档和压缩

《SpringBoot实现文件记录日志及日志文件自动归档和压缩》Logback是Java日志框架,通过Logger收集日志并经Appender输出至控制台、文件等,SpringBoot配置logbac... 目录1、什么是Logback2、SpringBoot实现文件记录日志,日志文件自动归档和压缩2.1、

qtcreater配置opencv遇到的坑及实践记录

《qtcreater配置opencv遇到的坑及实践记录》我配置opencv不管是按照网上的教程还是deepseek发现都有些问题,下面是我的配置方法以及实践成功的心得,感兴趣的朋友跟随小编一起看看吧... 目录电脑环境下载环境变量配置qmake加入外部库测试配置我配置opencv不管是按照网上的教程还是de