GPU云与算力租赁高频术语小词典:看懂弹性算力资源与服务
AI大模型训练催生了大量GPU算力租赁需求,但合同中的技术名词常让人困惑。这里梳理6个高频术语,帮你读懂服务商的报价单与配置表。
裸金属服务器:独占物理机,性能无干扰
裸金属服务器(Bare Metal)指的是用户直接租用整台物理GPU服务器,不经过虚拟化层。操作系统直接运行在硬件上,没有hypervisor开销。这对需要极致性能的深度学习训练场景至关重要——例如千亿参数大模型的分布式训练,内存带宽和PCIe通道必须全部归用户独占。2026年主流云厂商的裸金属方案已支持8卡NVIDIA H100或AMD MI300X直连,网络带宽达3.2Tbps。
适用场景:
- 训练任务对延迟和吞吐敏感,不容忍邻居噪声
- 需要安装自定义驱动、内核模块或特殊库
- 合规要求数据不经过共享虚拟化层
选择要点:
- 确认是否提供直通GPU(Pass-through)而非拆分虚拟化
- 检查网络卡类型(如Mellanox ConnectX-7)及互联拓扑(NVLink/InfiniBand)
- 注意计费模式:裸金属通常按包月或包年,比按需实例便宜但灵活性低
vGPU与设备虚拟化:共享一块卡,隔离多个任务
vGPU(Virtual GPU)是将一块物理GPU划分为多个逻辑切片的技术,每个切片拥有独立显存和算力配额。主流实现包括NVIDIA vGPU(基于GRID/MIG)和AMD MxGPU。MIG(多实例GPU)是硬件级分区,确保各实例严格隔离;而软件虚拟化(如SR-IOV)延迟略高但更灵活。
为什么需要vGPU:
- 图形渲染场景(如云游戏、CAD)需要低单价、多并发
- 轻量推理任务(如批量API调用)无需整卡算力
- 开发和测试环境可按需分配小资源
配置注意事项:
- 区分“显存划分”与“算力比例”,有些虚拟化只限制显存不限制CUDA核心
- 需要看vGPU调度器是否支持抢占式调度,避免长任务阻塞短任务
- 2026年部分厂商推出动态vGPU,可在任务空闲时释放部分切片给其他租户
Spot实例与抢占式实例:低价获取闲时算力
Spot实例是云厂商将闲置GPU资源以大幅折扣(通常50%-90% off)短期租出的模式。但缺点是实例可能随时被回收(termination notice通常提前30秒到2分钟)。这个术语在AWS叫Spot Instance,Azure叫Low Priority,Google Cloud叫Preemptible VM。
适用策略:
- 容错性高的任务:如超参数搜索、数据预处理、模型评估
- 可检查点保存的长时间任务:每5分钟保存一次中间状态,被回收后从断点续跑
- 批处理任务:对完成时间不苛刻,可批量提交
风险与应对:
- 价格波动:Spot价格实时更新,同一实例在不同可用区价差可达2倍
- 中断频率:热门机型(如A100)Spot可用率较低,建议组合使用多个实例池
- 2026年主流云商推出“持久化Spot”功能:自动替换被回收实例,但需提前配置备用池
按需计价与预留实例:弹性与成本的平衡
按需计价(On-Demand)指按实际使用时长(秒级或小时级)付费,用完即停。这是最灵活的计费方式,适合不确定时长或波动性需求。预留实例(Reserved Instance)是预付费锁定长期折扣(通常1年/3年,折扣30%-70%)。2026年还出现“即用即付+赎回权”的混合模式:支付少量保留费锁定预留条款,实际使用时支付较低使用费。
选择逻辑:
- 训练任务持续3个月以上:预留实例可节省40%+费用,但需预估GPU型号和区域
- 偶发爆量:按需实例+Spot混合,利用自动扩缩组调度
- 注意隐藏成本:按需实例的“停止”状态可能仍计费(保留存储和IP),需释放资源才清零
典型场景举例:某团队训练一个7B参数模型,每天运行12小时共30天。按需价格约12美元/小时,总计4320美元;若购买1年预留实例(75折)并覆盖这30天,实际支出可降至约3300美元,但需提前支付预留费。
弹性伸缩与自动扩缩:算力跟着负载走
弹性伸缩(Auto Scaling)指系统根据CPU/GPU利用率、队列长度或自定义指标自动增加或减少计算实例。在GPU云租赁中,伸缩组可以同时管理按需实例和Spot实例,实现成本与性能的平衡。2026年主流方案已支持“预测性扩缩”:基于历史负载曲线提前扩容,避免冷启动延迟。
关键参数:
- 冷却时间:扩缩后等待指标稳定的时间,避免震荡
- 较大/最小实例数:防止无限扩容导致预算超支
- 实例选择策略:优先使用Spot,Spot不可用时回退按需
使用建议:
- 为每个任务定义CPU/GPU阈值混合判断(仅看GPU利用率可能漏掉I/O瓶颈)
- 开启缩容保护:防止正在运行的训练任务被缩容中断,需设置完成为时锁
- 测试环境建议固定实例数,避免弹性伸缩造成的成本不可预期
资源编排与基础设施即代码:重复环境一键部署
资源编排(Orchestration)指通过模板定义服务器、网络、存储等所有云资源,并自动化创建。工具包括Terraform、AWS CloudFormation、Kubernetes Helm。在GPU云租赁中,常见需求是快速拉起一个分布式训练集群:包含多台裸金属、共享文件系统、容器镜像。通过IaC(基础设施即代码)可实现版本控制、审计和重复部署。
工作流程:
- 编写YAML/JSON模板声明GPU机型、数量、网络拓扑
- 运行命令将模板提交给云API,自动创建VPC、子网、安全组
- 安装配置DL framework和分布式训练库(如NCCL、Megatron)
- 任务完成后一键销毁所有资源,避免残留计费
常见陷阱:
- 模板中未指定GPU驱动版本,导致启动实例后需手动安装
- 网络拓扑未配置RDMA over Converged Ethernet,跨节点通信带宽受限
- 2026年部分服务商开始提供“训练集群蓝图”,内置了常见模型架构(如LLaMA、Stable Diffusion)的部署模板,但注意检查其是否支持自定义修改
常见问题
裸金属服务器相比普通云实例有什么优势
裸金属服务器提供独占物理资源,无虚拟化开销,适合对性能、延迟和隔离要求极高的训练任务。但价格较高且灵活性低。
vGPU适合哪些应用场景
vGPU适用于图形渲染、轻量推理和多租户开发测试。通过共享显卡降低成本,但需注意隔离级别和算力分配策略。
Spot实例被回收怎么办
提前配置检查点保存,每5-10分钟保存模型状态。被回收后自动从新实例恢复。也可使用云商提供的自动重试机制。
按需和预留实例怎么选更省钱
长期稳定任务选预留实例(折扣30%-70%);短时或不可预测任务选按需;混合使用:预留覆盖基线负载,按需+Spot应对峰值。
弹性伸缩如何避免成本失控
设置较大实例数上限,使用混合实例策略(优先Spot),并开启缩容保护防止任务中断。定期监控利用率调整阈值。
资源编排工具必须用吗
非必须但推荐。用模板部署可避免手动配置错误,便于环境重复和审计。对小团队,先手动熟悉流程再逐步迁移。