Google Cloud P100 已停止支持且资源无法继续访问时,按资源盘点、G2/G4 选择、快照备份、新 VM 验证、停机切换和回退逐步迁移。
Google Cloud 的 NVIDIA P100 已于 2026 年 9 月 15 日停止支持;此后不能再创建、启动或访问使用 P100 的 Compute Engine 实例和其他相关资源。这不是临时容量不足,反复重启或换时间重试不能恢复支持。正确做法是先盘点磁盘、镜像、区域和配额,再新建 G2(NVIDIA L4)或 G4(NVIDIA RTX PRO 6000)实例迁移工作负载,完成驱动、数据和业务验证后再切换流量。
不要直接删除旧实例。新旧资源并行期间会同时计费,最终写入同步和切换通常需要停机窗口。操作前至少保留磁盘快照和应用级备份;数据库还要做一致性备份,不能只依赖崩溃一致性快照。
先确认哪些 P100 资源受到影响
在 Google Cloud 控制台进入“Compute Engine → 虚拟机实例”,检查实例的区域、可用区、机器类型、GPU 类型、启动磁盘和附加数据盘。P100 的资源标识通常为 nvidia-tesla-p100;虚拟工作站版本可能显示 nvidia-tesla-p100-vws。
下面命令只读取实例和磁盘清单,不修改资源。请在已选择正确项目的 Cloud Shell 中执行,并把 PROJECT_ID 替换为实际项目 ID:
gcloud config set project PROJECT_ID
gcloud compute instances list \
--format="table(name,zone,machineType.basename(),guestAccelerators[].acceleratorType.basename(),guestAccelerators[].acceleratorCount,status)"
gcloud compute disks list \
--format="table(name,zone,type.basename(),sizeGb,status,users)"
第一条命令用于找出 P100 实例,第二条命令确认启动盘和数据盘仍是否存在、挂在哪个实例。gcloud config set project 会改变当前 Cloud Shell 的默认项目,但不会修改云资源;执行前后都应核对项目 ID,避免在错误项目创建收费实例。
官方停止支持范围不只包括 Compute Engine,还包括使用 P100 的 GKE 节点、Cloud Workstations、Dataflow、托管 Spark、Deep Learning VM 等。本文给出的是 Compute Engine 新 VM 迁移路径;托管服务应按对应服务的节点池或作业迁移文档处理,不能照搬实例磁盘步骤。
G2 和 G4 应该怎么选
| 目标 | 默认候选 | 选择依据 |
|---|---|---|
| AI 推理、生成式 AI 推理、视频转码、图形应用 | G2 / NVIDIA L4 | 24 GB GPU 显存;先验证模型显存、精度和吞吐是否满足 |
| 3D 渲染、Omniverse、虚拟工作站、本地大模型微调或更大显存推理 | G4 / NVIDIA RTX PRO 6000 | 96 GB GPU 显存;成本和区域可用性需在创建页重新核对 |
| 目标区域没有对应机型 | 换可用区或区域 | 先看业务延迟、数据驻留和网络成本,不能只按库存选择 |
| 需要原地改 P100 机器类型 | 不要尝试原地改 | 官方迁移路径是新建 G2/G4 VM;跨代 GPU 机器系列不能按普通停机改型处理 |
G2 与 G4 不是 P100 的逐项等价替换。CPU、内存、GPU 显存、磁盘类型、驱动、CUDA 与框架版本都可能变化。先用一个非生产实例跑真实模型或渲染任务,记录功能正确性、显存峰值、处理时间和错误日志,再决定最终规格。本文不提供性能倍数或固定价格承诺。
检查区域、配额和磁盘兼容性
在“Compute Engine → 配额和系统限制”检查目标区域的 GPU 配额,再到官方 GPU 区域列表确认 G2 或 G4 是否在目标可用区提供。配额获批不代表实时一定有容量;创建时报资源不可用时,应比较同区域其他可用区、兼容机型或其他区域。
下面命令读取目标可用区能看到的加速器类型:
gcloud compute accelerator-types list \
--filter="zone:(ZONE) AND (name=nvidia-l4 OR name~nvidia-rtx-pro-6000)" \
--format="table(name,zone)"
把 ZONE 替换为实际可用区,例如官方位置页列出的值。没有输出表示当前查询条件下没有匹配项,不等于所有区域都不可用。G2 不支持 pd-standard 标准持久磁盘;旧 P100 实例若使用该盘型,不能假设把原盘直接挂到 G2 就能完成迁移,应新建受支持盘型并通过快照恢复或文件级复制迁移。
先做快照和应用一致性备份
在“Compute Engine → 存储 → 快照”选择“创建快照”,逐一选择启动盘和数据盘。标准快照适合迁移前恢复点;快照会产生存储费用。正在写入数据库或队列时,应先按软件官方方法暂停写入、刷新缓存或制作应用备份,再创建快照。
快照任务进入可用状态后再继续。不要把“已点击创建”当作备份完成。至少随机选一个快照创建临时磁盘,挂载后读取关键文件;数据库备份还应在隔离环境执行恢复验证。验证失败时停止迁移,修复备份流程后重做。
新建 G2 或 G4 实例并迁移
- 进入“Compute Engine → 虚拟机实例 → 创建实例”,选择目标区域和可用区。
- 在机器配置中选择“GPU”,G2 选择 NVIDIA L4,G4 选择 NVIDIA RTX PRO 6000;按测试所需的 CPU、内存和 GPU 数量选择规格。
- 选择受支持的启动盘镜像和磁盘类型。若旧镜像内驱动或启动配置与新 GPU 不兼容,优先用受支持的新镜像安装应用,不要强行复用旧启动盘。
- 复制网络标签、服务账号、元数据和防火墙需求,但借机删除已无用途的宽泛权限。服务账号必须启用,才能完成 NVIDIA vGPU 驱动身份验证。
- 从已验证快照创建数据盘,或将新数据盘挂载后用文件/应用复制工具同步数据。
- 安装与新 GPU、操作系统、CUDA 和应用框架兼容的 NVIDIA 驱动。G2 使用 Container-Optimized OS 时,官方要求选择支持 L4 的系统版本和兼容驱动。
先让新实例使用临时内部地址或测试域名,不要创建完成后立即替换生产流量。若使用保留外部 IP,确认它是独立静态地址还是旧实例的临时地址;临时外部 IP 不能按静态地址迁移承诺处理。
怎样验收驱动、数据和业务
登录新实例后,先确认操作系统识别 GPU:
nvidia-smi
nvidia-smi --query-gpu=name,driver_version,memory.total,memory.used \
--format=csv,noheader
输出应显示目标 L4 或 RTX PRO 6000、有效驱动版本和合理的显存容量。命令不存在说明驱动未安装;显示无法与驱动通信时,检查驱动模块、内核兼容性和实例是否实际附带 GPU,不要继续切流。
随后依次验证:磁盘挂载点和权限、关键文件数量或校验值、数据库恢复、模型加载、一次真实推理或渲染任务、应用健康检查、日志和监控。性能测试应在相同输入和相近软件版本下进行;只看到 nvidia-smi 正常不能证明业务迁移完成。
切换、费用与回退
- 设定停机窗口,暂停旧环境写入并完成最后一次增量同步。
- 再次执行数据校验,确认新环境没有遗漏。
- 切换负载均衡后端、静态 IP 或 DNS;DNS 切换前提前降低 TTL,但传播时间仍取决于缓存。
- 观察错误率、任务成功率、GPU 显存、延迟和费用,不只检查首页是否打开。
- 达到事先约定的观察时间后,再决定是否释放旧磁盘、快照和保留地址。
若新实例驱动、性能或业务校验失败,停止新写入,把流量或 DNS 切回旧地址;数据已在新环境产生写入时,必须先决定如何回灌,不能直接双向启动造成冲突。由于 P100 本身已停止支持,旧 P100 实例不能作为长期可用的回退计算节点;真正可用的回退应是保留的数据、镜像、配置和另一台已验证的受支持 GPU 实例。
新旧 VM、磁盘、快照、静态外部 IP、跨区域复制与网络流量都可能分别计费。提交创建前查看控制台估算,切换后在“结算 → 费用明细/报告”核对实际项目和 SKU;不要只删除 VM 而遗留磁盘、快照或静态 IP。
相关阅读
官方来源
- Google Cloud:NVIDIA P100 停止支持与迁移建议
- Google Cloud:创建附带 GPU 的 Compute Engine 实例概览
- Google Cloud:创建 G2 或 G4 实例
- Google Cloud:创建标准与归档磁盘快照
资料核验日期:2026 年 9 月 25 日。黑鲨云可以协助核对由黑鲨云交付的 Google Cloud 账户资料和服务记录,但 GPU 生命周期、区域供应、配额审批和产品费用由 Google Cloud 决定;本稿未发现需要补充确认的黑鲨云业务事实。

