大模型时代大模型服务器配置清单选型研究
说大模型时代之前,说一下非大模型时代的服务器,非AI应用的话,主要是存储服务器和应用服务器,包括大数据时代也主要是存储服务器和计算服务器,存储、应用、计算服务器的特点主要是CPU、内存、磁盘这三类指标够大就OK,尤其内存、磁盘,多线程的应用对CPU也有要求。进入大模型时代后,动辄部署几个、十个二十个大模型或小模型,都是需要算力的,需要GPU卡的,而GPU卡是相当传统有些小贵的,如何合理规划算力和服务器配置也很重要了,涉及到钱了、涉及ROI划不划算了。
应用服务器和存储服务器按业务量去估算,估算3-5年,CPU、内存、硬盘的差不多够大,满足未来3-5年业务增长就ok,比较容易配置选型。如下述配置清单:
序号 | 名称 | 配置 | 数量 | 用途 |
1 | 存储服务器 | CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口; | 6台 | 提供存储空间。 |
2 | 应用服务器 | CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口; | 5台 | 提供应用服务。 |
根据业务量适当调整存储服务器、应用服务器配置和台数,如内存、硬盘、数量。
大模型时代的大模型服务器包括模型训练服务器、推理服务器,不同的模型偏好的配置稍有不同,共同点都是需要算力支撑、需要GPU算力卡,包括多模态大模型。因为模型发展太快了,不能按3-5年进行估算,起码1-2年内没问题,后续根据业务发展情况选用更优秀的大模型和更高的算力。根据以往项目经验看,华为Atlas 910B4 64G NPU卡比Atlas 300I DUO PCIE卡表现更好一些、推理速度更快一些。以下是参考的配置:
1 | 模型训练服务器 | CPU≥128核 ,主频≥2.6GHz,内存≥480G, 系统存储≥960GB SATA SSD,数据存储≥8TB,网络端口≥4个千兆电口+4个万兆光口;e NPU卡:8*Ascend 910B HB内存64G; | 60台 | 支持预训练、继续预训练、 全参数微调大模型 |
2 | 推理服务器 | CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD, GPU卡:配置8*Atlas 300I DUO PCIE卡(96GB);网卡:配置板载4口GE*1+双口25GE*1 | 1台 | Qwen2.5-72B-Instruct1 |
3 | 推理服务器 | CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD, GPU卡:8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1 | 1台 | RYS-Llama3.1-Large |
4 | 推理服务器 | CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥2*3.84TB NVME SSD,GPU卡:8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1 | 1台 | Mistral-Large-Instruct-2407 |
5 | 推理服务器 | CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥4*3.84TB NVME SSD,GPU卡: 8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1 | 1台 | Smaug-72B |
6 | 推理服务器 | CPU≥48核,主频2.6GHz,内存≥16*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥2*3.84TB NVME SSD,GPU卡:配置8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1 | 1台 | InternVL |
一般情况下,910B卡通过nvidia-smi查看GPU使用情况,300I DUO卡通过npu-smi info查看GPU使用情况。一般一台GPU服务器配置8块卡,八块卡怎么分配规划保证利用率最高、算力最大化利用也很重要。推理模型根据参数量进行估算,如Qwen3-32B最低2张卡,条件允许的话可以4张卡及以上,推理的速度会更快一些,当然Qwen3-72B参数规模就得8张卡了,算力太低的话,大模型根本跑不起来。如下是我们之前一个项目的GPU规划表,可以参考:
模型规划 | 卡数量 |
Qwen3-32B | 2张卡 |
Qwen2.5-VL-32B | 2张卡 |
文生视频 | 1张卡 |
文生图 | 1张卡 |
图生文 | 1张卡 |
视频转文字 | 1张卡 |
语音合成 | 0张卡(轻量化模型只用cpu) |
或者
模型规划 | 卡数量 |
Qwen3-32B | 3张卡 |
文生视频 | 1张卡 |
文生图 | 1张卡 |
图生文 | 1张卡 |
视频转文字 | 1张卡 |
语音合成 | 1张卡 |
或者条件允许的情况下,把推理大模型跟多模态大模型分开部署,推理模型使用4-6张卡,多模态大模型每个小模型使用2张卡,充分利用算力,把性能提上去,利益最大化。参与的过往的项目中,使用的多模态大模型主要有:文生图:Qwen/Qwen-Image、图生文:Qwen/Qwen2.5-VL-7B-Instruct、文图生视频:Wan-AI/Wan2.2-TI2V-5B、视频转文字:Whisper-large-v3、语音合成模型(文本转语音):IndexTTS-2,推理大模型使用Qwen3-32B大模型。当然Qwen72B参数大模型需要的配置更高。参考最低配置如下:
设备编号 | 配置 | 部署模型 | 模型类型 | 所需 NPU 卡数 |
设备 1 | 规格:4U机架式服务器; | Qwen2.5-72B-Instruct1 | 72B 大模型 | 4 卡 |
RYS-Llama3.1-Large | 等效 72B 大模型 | 4 卡 | ||
设备 2 | 规格:4U机架式服务器; | Mistral-Large-Instruct-2407 | 等效 72B 大模型 | 4 卡 |
Smaug-72B | 72B 大模型 | 4 卡 | ||
设备 3 | 规格:4U机架式服务器; | Qwen2.5-VL-7B-Instruct | 7B 视觉模型 | 2 卡 |
ModelTC/Qwen-Image-Lightning | 轻量视觉模型 | 2 卡 | ||
InternVL 14B | 视觉大模型 | 2 卡 | ||
Wan2.2-TI2V-5B | 跨模态模型 | 2 卡 | ||
大模型平台 | ||||
Whisper-large-v3 | 语音识别翻译模型(视频转文本) | 2 卡 | ||
IndexTTS-2 | 语音合成模型(文本转语音) | 2 卡 |
条件允许不差钱的情况下,推荐配置如下:
设备编号 | 配置 | 部署模型 | 模型类型 | 所需 NPU 卡数 |
设备 1 | 规格:4U机架式服务器; | Qwen2.5-72B-Instruct1 | 72B 大模型 | 8 卡 |
设备 2 | 规格:4U机架式服务器; | RYS-Llama3.1-Large | 等效 72B 大模型 | 8 卡 |
设备 3 | 规格:4U机架式服务器; | Mistral-Large-Instruct-2407 | 等效 72B 大模型 | 8 卡 |
设备 4 | 规格:4U机架式服务器; | Smaug-72B | 72B 大模型 | 8 卡 |
设备 5 | 规格:4U机架式服务器; | Qwen2.5-VL-7B-Instruct | 7B 视觉模型 | 2 卡 |
ModelTC/Qwen-Image-Lightning | 轻量视觉模型 | 2 卡 | ||
大模型平台 | ||||
设备 6 | 规格:4U机架式服务器; | InternVL 14B | 视觉大模型 | 4 卡 |
Wan2.2-TI2V-5B | 跨模态模型 | 4 卡 | ||
Whisper-large-v3 | 语音识别翻译模型(视频转文本) | 4 卡 | ||
IndexTTS-2 | 语音合成模型(文本转语音) | 4 卡 |
经济条件一般的企业,可以选择有些轻量级的多模态模型,使用CPU卡,不用GPU节省开支,当然了推理大模型、推理服务器,模型的参数和算力硬件方面要重点关注考虑、重点加大投入了,保证项目使用方用户体验。
