当前位置: 首页 > news >正文

大模型时代大模型服务器配置清单选型研究

说大模型时代之前,说一下非大模型时代的服务器,非AI应用的话,主要是存储服务器和应用服务器,包括大数据时代也主要是存储服务器和计算服务器,存储、应用、计算服务器的特点主要是CPU、内存、磁盘这三类指标够大就OK,尤其内存、磁盘,多线程的应用对CPU也有要求。进入大模型时代后,动辄部署几个、十个二十个大模型或小模型,都是需要算力的,需要GPU卡的,而GPU卡是相当传统有些小贵的,如何合理规划算力和服务器配置也很重要了,涉及到钱了、涉及ROI划不划算了。

应用服务器和存储服务器按业务量去估算,估算3-5年,CPU、内存、硬盘的差不多够大,满足未来3-5年业务增长就ok,比较容易配置选型。如下述配置清单:

序号

名称

配置

数量

用途

1

存储服务器

CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口;

6台

提供存储空间。

2

应用服务器

CPU≥64核,主频≥2.1GHz,内存≥512GB,系统存储≥480G SSD,数据存储≥96TB,单盘不小于8TB,网络端口≥4个千兆电口+4个万兆光口;

5台

提供应用服务。

根据业务量适当调整存储服务器、应用服务器配置和台数,如内存、硬盘、数量。

大模型时代的大模型服务器包括模型训练服务器、推理服务器,不同的模型偏好的配置稍有不同,共同点都是需要算力支撑、需要GPU算力卡,包括多模态大模型。因为模型发展太快了,不能按3-5年进行估算,起码1-2年内没问题,后续根据业务发展情况选用更优秀的大模型和更高的算力。根据以往项目经验看,华为Atlas 910B4 64G NPU卡比Atlas 300I DUO PCIE卡表现更好一些、推理速度更快一些。以下是参考的配置:

1

模型训练服务器

CPU≥128核 ,主频≥2.6GHz,内存≥480G,

系统存储≥960GB SATA SSD,数据存储≥8TB,网络端口≥4个千兆电口+4个万兆光口;e

NPU卡:8*Ascend 910B HB内存64G;

60台

支持预训练、继续预训练、

全参数微调大模型

2

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD,

GPU卡:配置8*Atlas 300I DUO PCIE卡(96GB);网卡:配置板载4口GE*1+双口25GE*1

1台

Qwen2.5-72B-Instruct1

3

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥4*3.84TB NVME SSD,

GPU卡:8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1

1台

RYS-Llama3.1-Large

4

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD,数据存储≥2*3.84TB NVME SSD,GPU卡:8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1

1台

Mistral-Large-Instruct-2407

5

推理服务器

CPU≥48核,主频2.6GHz,内存≥24*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥4*3.84TB NVME SSD,GPU卡: 8*Atlas 300I DUO PCIE卡(96GB),网卡:配置板载4口GE*1+双口25GE*1

1台

Smaug-72B

6

推理服务器

CPU≥48核,主频2.6GHz,内存≥16*64GB,系统存储≥2*960GB SATA SSD ,数据存储≥2*3.84TB NVME SSD,GPU卡:配置8*Atlas 910B4 64G NPU卡,互联带宽392GB/s,网卡:配置板载4口GE*1+自带8*200G NPU直出光口,双口25GE*1

1台

InternVL

一般情况下,910B卡通过nvidia-smi查看GPU使用情况,300I DUO卡通过npu-smi info查看GPU使用情况。一般一台GPU服务器配置8块卡,八块卡怎么分配规划保证利用率最高、算力最大化利用也很重要。推理模型根据参数量进行估算,如Qwen3-32B最低2张卡,条件允许的话可以4张卡及以上,推理的速度会更快一些,当然Qwen3-72B参数规模就得8张卡了,算力太低的话,大模型根本跑不起来。如下是我们之前一个项目的GPU规划表,可以参考:

模型规划

卡数量

Qwen3-32B

2张卡

Qwen2.5-VL-32B

2张卡

文生视频

1张卡

文生图

1张卡

图生文

1张卡

视频转文字

1张卡

语音合成

0张卡(轻量化模型只用cpu)

或者

模型规划

卡数量

Qwen3-32B

3张卡

文生视频

1张卡

文生图

1张卡

图生文

1张卡

视频转文字

1张卡

语音合成

1张卡

或者条件允许的情况下,把推理大模型跟多模态大模型分开部署,推理模型使用4-6张卡,多模态大模型每个小模型使用2张卡,充分利用算力,把性能提上去,利益最大化。参与的过往的项目中,使用的多模态大模型主要有:文生图:Qwen/Qwen-Image、图生文:Qwen/Qwen2.5-VL-7B-Instruct、文图生视频:Wan-AI/Wan2.2-TI2V-5B、视频转文字:Whisper-large-v3、语音合成模型(文本转语音):IndexTTS-2,推理大模型使用Qwen3-32B大模型。当然Qwen72B参数大模型需要的配置更高。参考最低配置如下:

设备编号

配置

部署模型

模型类型

所需 NPU 卡数

设备 1

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-72B-Instruct1

72B 大模型

4 卡

RYS-Llama3.1-Large

等效 72B 大模型

4 卡

设备 2

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Mistral-Large-Instruct-2407

等效 72B 大模型

4 卡

Smaug-72B

72B 大模型

4 卡

设备 3

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置8*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置12*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-VL-7B-Instruct

7B 视觉模型

2 卡

ModelTC/Qwen-Image-Lightning
funasr

轻量视觉模型

2 卡

InternVL 14B

视觉大模型

2 卡

Wan2.2-TI2V-5B

跨模态模型

2 卡

大模型平台

Whisper-large-v3

语音识别翻译模型(视频转文本)

2 卡

IndexTTS-2

语音合成模型(文本转语音)

2 卡

条件允许不差钱的情况下,推荐配置如下:

设备编号

配置

部署模型

模型类型

所需 NPU 卡数

设备 1

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-72B-Instruct1

72B 大模型

8 卡

设备 2

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

RYS-Llama3.1-Large

等效 72B 大模型

8 卡

设备 3

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Mistral-Large-Instruct-2407

等效 72B 大模型

8 卡

设备 4

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置8*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Smaug-72B

72B 大模型

8 卡

设备 5

规格:4U机架式服务器;
2、CPU:配置2颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置4*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

Qwen2.5-VL-7B-Instruct

7B 视觉模型

2 卡

ModelTC/Qwen-Image-Lightning
funasr

轻量视觉模型

2 卡

大模型平台

设备 6

规格:4U机架式服务器;
2、CPU:配置4颗HUAWEI Kunpeng 920 5250,单颗物理核数48核,主频2.6GHz;
3、内存:配置16*64GB;
4、硬盘:配置2块480GB SATA SSD系统盘,5块3.84TB NVME SSD数据盘;
raid卡:SP686C-M-16i 4G RAID0,1,5,6,10,50,60,4GB Cache
5、NPU卡:配置16*Ascend 910B 64G-HCCS
6、物理网卡:1*4*25GE(业务网)+4张 8*200GRCEE V2(参数网);
7、电源:配置4*2600W白金交流电源;2+2冗余
(910B芯片 320TFLOPS FP16,640TOPS INT8 ,显存为64GB HBM2e,显存带宽400GB/s)

InternVL 14B

视觉大模型

4 卡

Wan2.2-TI2V-5B

跨模态模型

4 卡

Whisper-large-v3

语音识别翻译模型(视频转文本)

4 卡

IndexTTS-2

语音合成模型(文本转语音)

4 卡

经济条件一般的企业,可以选择有些轻量级的多模态模型,使用CPU卡,不用GPU节省开支,当然了推理大模型、推理服务器,模型的参数和算力硬件方面要重点关注考虑、重点加大投入了,保证项目使用方用户体验。

http://www.cnnetsun.cn/news/4278911.html

相关文章:

  • Shapiro-Wilk与Shapiro-Francia检验:正态性检验原理与实战指南
  • 工厂和实体店用AI做推荐,有没有人试过?
  • Tikhonov正则化与L曲线:病态反问题的稳定求解实战指南
  • SAP ABAP增强重构:从Customer Exits到函数模块的架构优化实践
  • 普通面经(中):从算法手撕到HR面的避坑指南
  • 二级域名分发系统源码详解:部署实践与二次开发指南
  • 你真的会用 AI 辅助学习吗?我的 AI 学习利器:硅基流动 SiliconFlow
  • 基于差分进化算法优化LDPC码度分布的设计与实现
  • CISP-PTE实操题(自写靶场与题类似或变型)
  • 数学建模中的拟合技术:从原理到MATLAB/Python实战
  • GMSL车载HDR相机热插拔技术解析:从链路原理到工程落地
  • 字符串查找与替换:从原理到实战的性能优化与避坑指南
  • 单片机综合设计实战:电压频率采集与实时时钟系统开发指南
  • EN 50155认证铁路计算机:从工业电脑到车载加固平台的进阶之路
  • QT_HTTP协议编程
  • 第 9 篇 OCC OCAF 框架详解:特征树、装配管理、数据持久化、参数化架构
  • AI技能市场化的关键:从提示词操作到稳定交付
  • 8万字BAT面经的高效使用指南:从题海到Offer收割
  • 蓝桥杯算法竞赛备赛全攻略:从省一到国二的实战心法与技巧
  • 两个字段都建了单列索引,为什么加了 OR,执行计划还是全表扫描?
  • Agent Skills 入门到实战:从 Prompt 到可复用技能封装
  • 毕业论文降 AI 什么时候该花钱?快降重 VS 笔灵 AI,教育学硕士知网 AIGC 实测避坑
  • AI时代开发者进阶指南:从Prompt到大模型工程实践
  • GraphRAG实战:基于代码知识图谱的代码库问答实现
  • 硬盘健康监控与故障预警:用Hard Disk Sentinel看懂SMART数据
  • AI应用盈利难?从算力成本到工程优化的实战指南
  • 基于Mahout协同过滤的电影推荐系统:Java工程实践与毕业设计指南
  • WordPress浏览量计数器插件:精准统计、缓存兼容与性能优化全攻略
  • Python学习路线全解析:爬虫、数据分析、AI与自动化办公实战指南
  • 英伟达70%营收预期下,AI算力规划与GPU部署实战指南