LLM GPU Memory Estimator

大模型训练显存估算系统

输入模型参数、训练数据规模、精度与序列长度,自动推算 增量预训练 · SFT · RL(GRPO) · LoRA · QLoRA 的显存占用,并可折算到 H100 / H200 / B300 · 昇腾 910C / 950 等单卡所需数量。

模型
M百万
B十亿
T万亿
FP16/BF162.0 字节
FP81.0 字节
INT81.25 字节
INT40.55 字节
训练设置
AdamW FP328 B/param
AdamW FP164 B/param
AdamW FP82 B/param
INT8 量化2 B/param
Adafactor~1 B/param
×4
2
8
整体估算
模型权重
GB
全局批次 (batch·acc)
最高需求预训练显存
GB
各训练方式显存拆解 · 单 GPU 视角
所需 GPU 数量 · 按厂商峰值显存折算
设备厂商显存带宽 预训练SFTRLLoRAQLoRA
训练记忆体 & 模型/数据画像
说明:显存估算在"参数 + 优化器 + 梯度 + 激活"分桶模型上推导得出,并考虑 ZeRO / 重算 / 序列并行的实际等效分摊。下方罗列计算逻辑与原始来源。

估算结果用于规模规划(例如采购 / 容量评估),仅含训练过程 GPU 显存,不含 KV-Cache、推理路由、CPU Offload 等。
参考:NVIDIA H100 / H200 / Rubin (Vera); 华为 昇腾 官方规格。