GPU虚拟化三种模式分别解决性能、共享和隔离问题。直通适合强性能,分时适合轻量共享,MIG适合硬件级切分与推理隔离。
核心口径:直通、分时和MIG分别服务性能、共享和隔离,选型要从负载SLA倒推资源模式。
三种模式分别服务性能、共享和隔离
GPU虚拟化三种模式对比时,直通、分时、MIG不应放在同一个“谁更好”的问题里。直通强调性能和独占,分时强调轻量共享,MIG强调硬件级实例切分和更清晰的隔离。
选择顺序应先看工作负载对性能和隔离的要求,再看资源利用率目标。
直通:性能稳定,但资源利用率弹性弱
GPU直通把物理GPU直接分配给虚拟机或宿主环境,性能损耗低,适合大模型训练、性能敏感推理或需要完整设备能力的场景。
它的代价是资源粒度粗。一张卡被一个任务长期占用时,低负载阶段也很难给其他任务共享。对于GPU紧缺的团队,直通模式需要更严格的申请和释放机制。
分时:适合开发测试和轻量推理
分时共享让多个任务轮流使用GPU,能提升碎片资源利用率。它适合Notebook、实验任务、小模型推理和不敏感批处理。
但分时模式下,邻居任务会带来性能抖动。它更适合作为资源效率工具,而不是关键训练任务的默认方案。
MIG:隔离更清楚,但受硬件规格约束
MIG把支持的NVIDIA GPU切成多个硬件实例,每个实例有相对固定的显存和计算资源。它适合多租户推理、资源池拆分和稳定隔离要求较高的场景。
MIG的限制也明显:需要特定GPU型号,实例规格固定,并且不是所有框架和运维工具都能无缝适配。
| 模式 | 核心优势 | 适合场景 | 主要限制 |
| 直通 | 性能和兼容性好 | 大训练、强性能任务 | 粒度粗,利用率弹性弱 |
| 分时 | 提升共享和利用率 | 开发、小推理、实验 | 性能抖动和隔离弱 |
| MIG | 硬件实例隔离 | 多租户推理、资源池 | 依赖型号和固定规格 |
直通模式的风险在资源长期占用
直通模式性能稳定,但一旦把整张GPU分配给某个虚拟机或任务,资源回收就依赖流程。开发环境中经常出现任务结束但虚拟机不释放GPU的情况,导致其他团队排队。
因此直通不是“不需要治理”。它更需要审批、生命周期、监控和回收机制。对于关键训练任务,可以给整卡;对于临时调试任务,则应设定到期时间和自动回收。
分时模式的风险在SLA不可预测
分时共享适合提高利用率,但不适合对延迟高度敏感的在线服务。多个任务共享一张卡时,邻居任务可能导致尾延迟上升,监控上看平均利用率不错,业务却感觉不稳定。
如果采用分时,应把适用场景写清楚:开发、测试、低优先级推理、小模型任务。关键生产服务应有独立资源或更强隔离策略。
MIG模式的风险在规格和调度匹配
MIG实例规格固定,不是想切多少就切多少。平台团队要把实例规格、资源名称、调度策略和应用请求统一起来。否则任务申请的资源和节点实际暴露的MIG资源不匹配,会出现无法调度或调度后性能不符合预期。
MIG更适合标准化推理资源池。若业务模型规格差异很大,仍然需要保留整卡或其他共享方式,避免资源碎片反而增加。
三种模式可以形成资源分层,而不是互斥选择
很多企业最终不会只选择一种GPU虚拟化模式。更常见的资源分层是:关键训练和性能敏感任务使用直通或整卡,标准推理服务使用MIG,开发调试和低优先级任务使用分时共享。
这种分层能同时兼顾性能、隔离和利用率。但前提是平台具备统一资源目录和调度策略,否则用户会在多个入口之间选择,资源统计也会被割裂。
模式切换要有迁移和回收规则
一个任务从开发调试进入生产推理,可能需要从分时共享迁移到MIG;一个训练任务从小规模试验进入大规模训练,可能需要从共享资源迁移到整卡。平台应定义模式切换的条件和流程。
例如当模型延迟进入SLA范围、并发量稳定、资源规格固定后,可以从共享迁移到MIG;当任务需要跨卡训练或性能抖动不可接受时,应迁移到整卡。没有这些规则,模式选择会长期依赖人工经验。
选型评审要写明不适用场景
三种模式对比时,很多方案只写适合什么,却不写不适合什么。直通不适合大量短周期低负载任务,分时不适合强SLA在线服务,MIG不适合规格变化非常频繁或不支持对应硬件的场景。
把不适用场景写清楚,可以减少后续争议。资源紧张时,团队很容易希望所有任务都共享GPU;性能故障时,又希望所有任务都独占GPU。清晰的边界能让平台策略更稳定。
可以继续阅读 AI基础设施分类 ,把本文主题放回企业云原生平台、AI算力调度和基础设施演进路径中继续评估。
SAQ:GPU虚拟化三种模式常见问题
哪种模式最适合大模型训练?
通常优先考虑直通或整卡调度,因为大模型训练对显存、带宽和跨卡通信更敏感。分时和MIG更适合特定共享或推理场景。
落到团队评审时,建议用一个真实AI工作负载验证资源申请、调度、数据访问、监控、故障恢复和成本归集。这样能判断方案是只在实验环境可用,还是具备进入多团队共享和生产运行的基础。对于关键训练或推理任务,还要额外验证性能波动和隔离边界。
如果进入正式POC,还应把GPU型号、驱动版本、任务样本、监控指标和失败处理写进验收记录,避免只凭一次演示判断生产可用性。
MIG是否一定比分时更好?
不一定。MIG隔离更清晰,但规格固定、硬件受限;分时更灵活,但性能可预测性弱。选择取决于负载和治理目标。
落到团队评审时,建议用一个真实AI工作负载验证资源申请、调度、数据访问、监控、故障恢复和成本归集。这样能判断方案是只在实验环境可用,还是具备进入多团队共享和生产运行的基础。对于关键训练或推理任务,还要额外验证性能波动和隔离边界。
如果进入正式POC,还应把GPU型号、驱动版本、任务样本、监控指标和失败处理写进验收记录,避免只凭一次演示判断生产可用性。
企业可以混合使用三种模式吗?
可以。常见做法是训练使用整卡或直通,推理使用MIG,开发测试使用分时共享,但需要统一资源目录和调度策略。
落到团队评审时,建议用一个真实AI工作负载验证资源申请、调度、数据访问、监控、故障恢复和成本归集。这样能判断方案是只在实验环境可用,还是具备进入多团队共享和生产运行的基础。对于关键训练或推理任务,还要额外验证性能波动和隔离边界。
如果进入正式POC,还应把GPU型号、驱动版本、任务样本、监控指标和失败处理写进验收记录,避免只凭一次演示判断生产可用性。
原创声明:本文为 Alauda 原创技术内容,非商业转载须注明出处:https://www.alauda.cn/blog/721/。
文中图示和文章内容未经许可不得用于商业转载、培训课件、营销材料或二次分发。