【环境配置】Ubuntu系统下Pytorch安装
一、PytorchPyTorch是一个开源的深度学习框架该框架由Facebook人工智能研究院的Torch7团队开发它的底层基于Torch但实现与运用全部是由python来完成。该框架主要用于人工智能领域的科学研究与应用开发。官网提供了最新版本并且提供了早期版本的安装方法Pytorch官网https://pytorch.org/早期版本地址https://pytorch.org/get-started/previous-versions/一、GPU驱动我们一般称显卡就是GPU现在大部分需要使用深度学习算法的服务器使用的都是NVIDIA公司生产的显卡。常见产品系列和产品请查看链接: https://www.nvidia.cn/geforce/drivers/官方提供了最新的显卡驱动版本找到显卡型号就可以下载。在win10系统下我们可以通过NVIDA控制面板查看驱动对应的版本如下图所示笔记本上搭载了RTX3060显卡驱动版本为512.36。二、CUDA三、cuDNN四、GPU驱动、CUDA、cuDNN对应关系Ubuntu GPU驱动版本 / CUDA版本 / cuDNN版本 都需要互相关联版本不对应会报错版本确认顺序CUDA版本 -- CuDNN版本 -- GPU驱动版本安装顺序GPU驱动版本 -- CUDA版本 -- CuDNN版本一确定CUDA版本CUDA下载https://developer.nvidia.com/cuda-toolkit-archive官方对应文档https://docs.nvidia.com/cuda/cuda-toolkit-release-notes/index.html我们安装CUDA 10.0.130需要410.48以上的版本同时可以根据CUDA下载的文件名进行判断例cuda_10.0.130_410.48_linux.run表示为cuda_cuda版本号_显卡驱动最低要求版本号_操作系统名称.run。二确定cuDNN版本cuDNN下载https://developer.nvidia.com/rdp/cudnn-archive其中展示了对应不同CUDA版本的cuDNN根据提示选择即可。由于我们安装的是CUDA10.0因此我们需要找后缀是“for CUDA 10.0”。并不需要下载最新的版本根据项目代码的要求我下载了cuDNN v7.6.4cudnn-10.0-linux-x64-v7.6.4.38.tgz此处需要注册账号才能下载。三确定GPU驱动版本GPU驱动历史版本下载http://download.nvidia.com/XFree86/Linux-x86_64/五、卸载原有驱动如果之前安装过GPU驱动、CUDA和cuDNN1. GPU驱动卸载GPU驱动安装后建议保留安装文件有安装文件使用第一条命令没有安装文件使用第二条sudo sh NVIDIA-Linux-x86_64-390.116.run --uninstall 或 sudo /usr/bin/nvidia-uninstall在命令行输入nvidia-smi如果没有反应或者显示找不到指令则说明卸载成功。2. CUDA和cuDNN卸载以CUDA 10.0为例直接执行以下命令注意你需要卸载的CUDA版本更改路径。sudo /usr/local/cuda-10.0/bin/uninstall_cuda_10.0.plCUDA 11.x卸载文件的位置有变化以CUDA 11.1为例卸载文件的命令sudo /usr/local/cuda-11.1/bin/cuda-uninstaller卸载之后我们发现cuda-10.0文件夹中还有一些文件这些是拷贝过来的cuDNN文件将cuda-10.0文件夹删除也就完成了对应的cuDNN的卸载。六、以Ubuntu16.04、RTX2060为例安装GPU驱动NVIDIA-Linux-x86_64-440.82.run、CUDAcuda_10.0.130_410.48_linux.run和cuDNN七、验证安装1. GPU驱动nvidia-smi2. CUDAnvcc -V3. cuDNNcat /usr/local/cuda/include/cudnn.h | grep CUDNN_MAJOR -A 2 或者 cat /usr/local/cuda/include/cudnn_version.h | grep CUDNN_MAJOR -A 2需要注意/usr/local/cuda实际上是一个软链接指向的是同级目录下的cuda-10.2或者cuda-11.3有的人找不到这个软链接但是cuda依然可以使用是因为.bashrc里面的cuda路径是cuda-10.2路径而非链接因此在验证cuDNN是否安装成功时可以将其中的cuda改为你做安装的版本路径。我安装过各种各样的设备除上述应该不会有其他问题了八、注意事项1. NVIDIA-SMI has failed because it couldnt communicate with the NVIDIA driver. Make sure that the latest NVIDIA driver is installed and running. 在驱动使用过程中nvidia-smi失效解决方法step 1: sudo apt-get install dkmsstep 2: sudo dkms install -m nvidia -v 410.79410.79是nvidia版本号需要根据自己的修改。进入/usr/src目录找到前缀为nvidia文件夹其附带的就是版本号。2. Failed to verify gcc version. See log at /var/log/cuda-installer.log for details. 在Ubuntu20.04中安装CUDA10.2出现的问题在Ubuntu20.04中显卡驱动版本高但安装的cuda版本低报gcc版本过高的错误可以参考以下链接解决问题Ubuntu20.04安装cuda10.1_feng98ren的博客-CSDN博客