返回知识库
AI阅读约 10 分钟

DeepSeek 类开源大模型本地部署:按参数量和并发估算服务器配置

本地部署开源大模型的配置估算,应从模型参数量、量化方式、并发人数和上下文长度出发,先算显存下限,再定单机高显存、单机多卡还是多机方向,最后核对内存、NVMe、网络和机房条件。具体型号和参数需按项目确认。

咨询本文相关配置
文章目录

内容提要

本地大模型的文档任务与多用户访问的技术场景插画
AI 辅助技术场景示意:说明本地大模型的文档任务与多用户访问。不是产品实拍、客户现场、软件截图或实测结果,具体配置与流程须另行核验。

部署前先回答三个问题

第一,模型多大:是 7B、14B、32B 还是 70B 级,用什么量化精度。第二,多少人用:是个人验证、部门内几十人,还是要对外提供服务,并发和上下文长度直接决定显存放大倍数。第三,数据边界:资料能不能出内网。三个问题没答清楚之前,讨论具体显卡型号意义不大。

参数量和量化决定显存下限

权重占用可先按参数量乘以每参数字节数估量:FP16 约 2 字节,INT8 约 1 字节,INT4 约 0.5 字节;量化元数据、部分未量化层与运行时会额外占用。70B 的 INT4 原始权重约 35GB,不代表必需多卡:仍要比较具体单卡容量、KV cache、框架和目标延迟。

并发和上下文会放大显存需求

并发请求与上下文通常会增加 KV cache,但增长方式还取决于模型结构、缓存精度、共享前缀、滑动窗口和框架调度。应记录完整输入与输出长度、峰值并发和具体缓存策略,用目标模型实测;不能统一套用权重的固定倍数作为可采购显存。

三种落地形态:高显存工作站、单机多卡、多机

单人验证可评估高显存工作站,长期共享服务可评估机架式 GPU 平台,多节点则应在单节点容量、吞吐或可用性边界不能满足时再论证。70B 等参数规模不能单独决定单卡、多卡或多机。G/T/Z 是产品方向,最终需核对实际卡型、模型切分、环境和机房条件。

显卡之外:CPU、内存、NVMe 和网络

CPU、系统内存与存储要覆盖模型加载、量化、缓存、文档处理和并发服务。采用卸载或模型转换时,系统内存峰值可能明显变化;不以显存总量的固定比例代替测量。NVMe、向量库与网络按冷启动、数据更新和目标延迟分别核对。

常见误判

一是只看显存容量不看显存带宽和卡间互联,多卡方案里后两者经常才是瓶颈;二是把训练机的思路直接搬到推理场景,为用不上的互联和扩展性付费;三是忽略供电散热,多卡服务器满载功耗和噪音都不适合普通办公环境;四是相信某配置一定能跑某模型的说法,实际能不能跑、跑到什么效果,取决于量化、框架、并发和上下文,需要按项目实测。

下一步怎么走

把模型参数量、量化打算、使用人数、上下文长度、数据边界、部署位置和预算口径写清楚,就可以进入配置初筛。可以先用页面上的 AI 配置顾问按这几个条件过一遍,得到一个初步方向;需要正式方案时提交项目需求,提交后由方案工程师继续确认配置、含税预算与交付范围。

选型检查清单

  • 确认模型参数量、量化精度和是否需要多模型常驻
  • 确认并发人数、上下文长度和响应要求
  • 确认数据边界:资料是否必须留在内网
  • 按权重下限加并发余量估显存,再定单卡、多卡或多机
  • 核对内存、NVMe、网络、供电散热和部署位置

适用范围与资料依据

权重裸容量不是完整运行显存;KV Cache 还取决于模型注意力结构、缓存类型、精度和部署策略。

资料链接核对:。具体版本支持以软件厂商最新文档为准。

本地部署大模型推理GPU服务器

继续核对产品与项目条件

把资料与实际项目放在一起判断

软件版本、数据规模、预算和部署条件,是工程师继续核对配置的依据。