跳到主要内容
注册无需实名认证
安云主机 AnYun VPS

术语表 · GPU 与算力

大模型

Large Language Model (LLM)

又写作

LLM大语言模型damoxing基座模型

要点

什么是大模型?

大模型是参数量在十亿级以上的深度学习模型的统称,中文语境下通常特指大语言模型(LLM);模型名字里的 7B、13B、70B 指的就是参数量,它直接决定了运行所需的显存。

公开权重的模型家族(Llama、Qwen、DeepSeek、Mistral 等)是租用 GPU 的主要动因:权重可以自己下载,剩下的问题就只是找到一台放得下它的机器。这也是「租卡」与「买 API」的分界线——前者数据不出自己的机器,后者省事但要把内容交出去。

参数量到显存的换算见「显存」词条:FP16 大约是参数量乘以二,4-bit 量化后大约降到四分之一。选卡时按这个顺序走一遍,通常五分钟内就能定下需要哪一档。

常见误解

参数量不是能力的唯一指标:同为 7B 的两个模型差别可能很大,而针对具体任务微调过的小模型,常常胜过没调过的大模型。先用小模型把流程跑通,再决定要不要更大的卡——这比一上来就租最贵的卡省得多。

本站相关页面

按模型规模选配置

相关术语

和「大模型」一起看 4 条

显存 VRAM (Video Memory)

显存是显卡上独立于系统内存的高速存储,模型权重、激活值与缓存都必须放进显存,因此显存容量决定一块 GPU 能不能跑某个模型——放不下就完全跑不起来,而算力不足只是跑得慢。

推理 Inference

推理指用已经训练好的模型产生结果的过程——生成文本、出图、语音转写、目标检测都属于推理,它是 GPU 租用中最常见的用途,显存要求由模型大小决定,速度要求由并发量决定。

量化 Quantization

量化指把模型权重从 16 位浮点降到 8 位或 4 位整数存储,用可接受的精度损失换取显存占用的成倍下降,是让大模型挤进单张消费级显卡的标准手段。

微调 Fine-Tuning

微调指在已经预训练好的模型上用自己的数据继续训练,使它适应特定任务、格式或语气,是中小团队最现实的定制方式——从零训练一个大模型的成本,与租几张卡跑几个小时不在一个数量级。

联系 工单
扫码
手机访问

扫码在手机上打开