文章目录
内容提要

部署前先回答三个问题
第一,模型多大:是 7B、14B、32B 还是 70B 级,用什么量化精度。第二,多少人用:是个人验证、部门内几十人,还是要对外提供服务,并发和上下文长度直接决定显存放大倍数。第三,数据边界:资料能不能出内网。三个问题没答清楚之前,讨论具体显卡型号意义不大。
参数量和量化决定显存下限
权重占用可先按参数量乘以每参数字节数估量:FP16 约 2 字节,INT8 约 1 字节,INT4 约 0.5 字节;量化元数据、部分未量化层与运行时会额外占用。70B 的 INT4 原始权重约 35GB,不代表必需多卡:仍要比较具体单卡容量、KV cache、框架和目标延迟。
并发和上下文会放大显存需求
并发请求与上下文通常会增加 KV cache,但增长方式还取决于模型结构、缓存精度、共享前缀、滑动窗口和框架调度。应记录完整输入与输出长度、峰值并发和具体缓存策略,用目标模型实测;不能统一套用权重的固定倍数作为可采购显存。
三种落地形态:高显存工作站、单机多卡、多机
单人验证可评估高显存工作站,长期共享服务可评估机架式 GPU 平台,多节点则应在单节点容量、吞吐或可用性边界不能满足时再论证。70B 等参数规模不能单独决定单卡、多卡或多机。G/T/Z 是产品方向,最终需核对实际卡型、模型切分、环境和机房条件。
显卡之外:CPU、内存、NVMe 和网络
CPU、系统内存与存储要覆盖模型加载、量化、缓存、文档处理和并发服务。采用卸载或模型转换时,系统内存峰值可能明显变化;不以显存总量的固定比例代替测量。NVMe、向量库与网络按冷启动、数据更新和目标延迟分别核对。
常见误判
一是只看显存容量不看显存带宽和卡间互联,多卡方案里后两者经常才是瓶颈;二是把训练机的思路直接搬到推理场景,为用不上的互联和扩展性付费;三是忽略供电散热,多卡服务器满载功耗和噪音都不适合普通办公环境;四是相信某配置一定能跑某模型的说法,实际能不能跑、跑到什么效果,取决于量化、框架、并发和上下文,需要按项目实测。
下一步怎么走
把模型参数量、量化打算、使用人数、上下文长度、数据边界、部署位置和预算口径写清楚,就可以进入配置初筛。可以先用页面上的 AI 配置顾问按这几个条件过一遍,得到一个初步方向;需要正式方案时提交项目需求,提交后由方案工程师继续确认配置、含税预算与交付范围。
选型检查清单
- 确认模型参数量、量化精度和是否需要多模型常驻
- 确认并发人数、上下文长度和响应要求
- 确认数据边界:资料是否必须留在内网
- 按权重下限加并发余量估显存,再定单卡、多卡或多机
- 核对内存、NVMe、网络、供电散热和部署位置
适用范围与资料依据
权重裸容量不是完整运行显存;KV Cache 还取决于模型注意力结构、缓存类型、精度和部署策略。
资料链接核对:。具体版本支持以软件厂商最新文档为准。
