准备租 H100 跑一晚训练,看到 Nebius 的抢占价,比按需价低不少,确实值得停下来算一算。不过我会先问:训练跑到第六个小时被停掉,你能从哪一步接着跑?答得出来,低价才更可能落到账单里。
这篇关注 H100 NVLink 在 eu-north1 的公开计费条件。2026年10月1日起,官方表中的按需 GPU 小时价已从 US$3.85 变为 US$4.50;抢占栏列 US$2.15。旧文章的3.85美元,不能再直接拿来算当前这一区域的预算。[1]
先看十个 GPU 小时的差额
| H100 NVLink 计费方式 | 当前 GPU 单价 | 假设消耗10个 GPU 小时 |
|---|---|---|
| 按需 | US$4.50/GPU小时 | US$45.00 |
| 抢占 | US$2.15/GPU小时 | US$21.50 |
| 两者差额 | US$2.35/GPU小时 | US$23.50 |
这是按公开单价相乘的 GPU 费用小计,没有包含磁盘、网络、税费及其他资源,也没保证你能连续拿到十小时。一台多卡实例要按实际卡数累计 GPU 小时;抢占文档还说明按当前 Spot 价格收费,应核对下单时的价格策略。[1][2]
低价之前,先给任务一个能回来继续的办法
官方文档说,抢占 VM 随时可能被停止,停止前发送60秒的 SIGTERM 通知。我的建议是平时就定期保存检查点,不要指望只靠最后一分钟完成所有保存。[2]
检查点要放对地方。停止后,附加卷的数据会保留;本地 SSD 属于临时存储,停止时其中的数据会丢失。动态公网IP也可能释放。能继续训练,至少要能重新找到模型状态、数据集和日志,重新连接也要考虑地址变化。
如果训练脚本还不会从检查点恢复,我会先用较短任务验证保存和恢复过程,再考虑让它跑一整晚。这里没有本站实际中断测试,60秒也不代表所有程序都能及时完成保存。
什么任务更值得考虑抢占?
能拆成批次的实验、没有硬截止时间的训练、可以从检查点继续的作业,我会更愿意比较抢占。任务中断后只是晚一点交付,省下来的 GPU 费用有机会超过重跑成本。
如果你正给客户演示,或者第二天必须交结果,却还没有恢复办法,我会把连续运行的安排放在价格前面。按需同样需要自己的备份和监控,不能当成永不中断的保证。
决定之前,写下你能承受丢失的进度,以及需要保留哪些资源。再去官方计费表核对区域、平台、卡数和 Spot 策略,低价就有了具体使用场景。
资料核对与适用范围
2026-10-05重读Nebius计费与抢占VM文档。十GPU小时45/21.5/差23.5美元仅单价算术;60秒通知、卷及本地SSD为文档条件,未租机或中断恢复。
Spot按当前价及策略计费,不保证连续十小时、库存或固定未来价。费用小计不含磁盘网络税费;60秒不能保证程序完成保存,也无可用性亲测。