AI显存需求计算器
按参数量、量化精度与上下文长度精确估算本地部署大模型的显存需求
工具界面
交互式工具即将上线
功能特点
- ✓ 支持 1B-400B 任意参数量模型估算
- ✓ 支持 FP16/BF16/INT8/INT4 量化精度
- ✓ 精确计算 KV Cache 与激活内存开销
- ✓ 内置 Llama、Qwen、DeepSeek、Mistral 模型库
- ✓ 推荐最低与推荐显存配置及对应 GPU 型号
使用步骤
- 选择模型或输入参数量
- 选择量化精度与上下文长度
- 设置批处理大小与推理框架
- 点击计算,查看显存需求与 GPU 推荐
常见问题
AI显存需求计算器 是什么?
一款在线AI显存计算工具。功能:根据模型参数量、量化精度与上下文长度估算本地部署大模型所需的显存。输入:模型规模、量化精度、上下文长度等参数。输出:显存需求估算结果与GPU选型建议,支持一键复制和下载。所有计算在浏览器内完成。
计算结果准确吗?
计算结果基于业界通用的显存计算公式(权重 + 优化器状态 + KV Cache + 激活内存),并参考主流推理框架(llama.cpp、vLLM、Transformers)的实际占用,误差通常在 10% 以内。
什么是 KV Cache?为什么影响显存?
KV Cache 是推理时缓存的键值对,用于加速生成。它随上下文长度线性增长,是长上下文场景下显存的主要开销之一,计算器会精确计入这一部分。
INT4 量化后显存能减少多少?
以 FP16 为基准,INT8 约减少一半显存,INT4 约减少 75%。但量化会带来轻微的精度损失,计算器会同时展示不同精度下的显存与推荐配置。
支持哪些推理框架?
支持 llama.cpp、vLLM、Transformers、Ollama 等主流推理框架,不同框架的显存开销略有差异,计算器会自动调整估算结果。