「大模型运维」池化混部和共享混部区别和关系
共享混部 vs 池化混部:定义、区别、内在关系
一、基础定义
1. 共享混部(单卡/单机本地共享)
核心:单张GPU/单台机器内部,多任务/多模型并行占用同一份硬件资源
只局限单机内资源复用,不跨服务器调度:
- 同卡多模型混部:一张GPU同时跑多个推理服务(如ToB文生图、告警分析、工单计算);
- 在离线混部:在线推理(高优低延迟)+离线批处理(低优可抢占)跑在同卡;
- 实现手段:MIG、vGPU、显存分时、KV缓存共享、进程隔离;
- 边界:资源只在本机分配,算力不能跨机器调度。
2. 池化混部(全局算力池+全域共享)
核心:把全机房/多集群所有GPU统一抽象为一个全局算力资源池,跨机器动态分配、弹性复用
池化天然包含共享混部能力,是更大范围的资源调度架构:
- 先做全局资源抽象:所有物理GPU、vGPU、切分算力统一注册到调度池;
- 调度器跨机器分配算力:任务可落在任意空闲节点;
- 单节点内部自动执行共享混部填充空闲算力;
- 支持算力远程调度、任务热迁移、异构卡统一管理。
