跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

CUDA

CUDA (Compute Unified Device Architecture)

又写作

统一计算架构CUDA 核心cuda toolkitnvcc

要点

什么是CUDA?

CUDA 是 NVIDIA 的并行计算平台与编程接口,PyTorch、TensorFlow 等框架的 GPU 加速全部经由它实现,因此实践中「这台机器能不能跑我的代码」等于「驱动、CUDA 版本与框架编译版本是否对得上」。

版本关系是三层的:显卡驱动决定最高能支持的 CUDA 版本,CUDA Runtime 是实际安装的那一套,框架(PyTorch 等)在编译时又绑定了某个 CUDA 版本。三者错配的典型症状是 torch.cuda.is_available() 返回 False,或者程序启动时报缺少某个 so 库。

这也是「预装镜像」在这个市场是真实卖点的原因:没人愿意把第一个计费小时花在装驱动上。本站的镜像按框架与 CUDA 版本成对固定,不提供会随时间漂移的「最新版」——那种镜像会在某天早上悄悄改掉你的运行环境。

新架构的卡(如 RTX 5090)需要更新的 CUDA 与框架版本才能正常工作,旧版本可能根本认不出这张卡。上机前先确认你的代码栈支持,比开机后再排查省钱。

常见误解

nvidia-smi 右上角显示的 CUDA 版本是驱动所能支持的最高版本,不是系统里装着的 Runtime 版本。真正在用的那个要用 nvcc -V 或框架自己报告的版本号来确认,这两个数字对不上是完全正常的。

三层版本,三条命令

nvidia-smi | head -3   # 驱动版本 + 它支持的最高 CUDA 版本
nvcc -V                # 实际安装的 CUDA Runtime 版本
python -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available())"

相关术语

和「CUDA」一起看 4 条

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

推理 Inference

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

炼丹 Model Training (slang)

炼丹是中文机器学习圈对训练模型的戏称,取自结果难以预测、只能反复调参试出来的过程;「炼丹炉」指用来训练的机器,「丹」指训练出来的模型权重。

算力 Compute Power (FLOPS)

算力指 GPU 每秒能完成的浮点运算次数,通常以 TFLOPS 标注,它决定模型跑得多快;算力与显存是两个互不替代的维度——显存决定能不能跑,算力决定跑得快不快。

联系 工单
扫码
手机访问

扫码在手机上打开