跳到主要内容
返回GPU Cloud产品列表
返回优惠情报
GPU Cloud · 优惠解读

Nebius H100抢占价:一晚训练被中断,省的钱够补跑吗?

Nebius

对照eu-north1的H100按需与抢占价格,先算十个GPU小时的费用,再安排检查点恢复。附加卷、本地SSD和动态IP分别处理。

准备租 H100 跑一晚训练,看到 Nebius 的抢占价,比按需价低不少,确实值得停下来算一算。不过我会先问:训练跑到第六个小时被停掉,你能从哪一步接着跑?答得出来,低价才更可能落到账单里。

这篇关注 H100 NVLink 在 eu-north1 的公开计费条件。2026年10月1日起,官方表中的按需 GPU 小时价已从 US$3.85 变为 US$4.50;抢占栏列 US$2.15。旧文章的3.85美元,不能再直接拿来算当前这一区域的预算。[1]

先看十个 GPU 小时的差额

H100 NVLink 计费方式当前 GPU 单价假设消耗10个 GPU 小时
按需US$4.50/GPU小时US$45.00
抢占US$2.15/GPU小时US$21.50
两者差额US$2.35/GPU小时US$23.50

这是按公开单价相乘的 GPU 费用小计,没有包含磁盘、网络、税费及其他资源,也没保证你能连续拿到十小时。一台多卡实例要按实际卡数累计 GPU 小时;抢占文档还说明按当前 Spot 价格收费,应核对下单时的价格策略。[1][2]

低价之前,先给任务一个能回来继续的办法

官方文档说,抢占 VM 随时可能被停止,停止前发送60秒的 SIGTERM 通知。我的建议是平时就定期保存检查点,不要指望只靠最后一分钟完成所有保存。[2]

检查点要放对地方。停止后,附加卷的数据会保留;本地 SSD 属于临时存储,停止时其中的数据会丢失。动态公网IP也可能释放。能继续训练,至少要能重新找到模型状态、数据集和日志,重新连接也要考虑地址变化。

如果训练脚本还不会从检查点恢复,我会先用较短任务验证保存和恢复过程,再考虑让它跑一整晚。这里没有本站实际中断测试,60秒也不代表所有程序都能及时完成保存。

什么任务更值得考虑抢占?

能拆成批次的实验、没有硬截止时间的训练、可以从检查点继续的作业,我会更愿意比较抢占。任务中断后只是晚一点交付,省下来的 GPU 费用有机会超过重跑成本。

如果你正给客户演示,或者第二天必须交结果,却还没有恢复办法,我会把连续运行的安排放在价格前面。按需同样需要自己的备份和监控,不能当成永不中断的保证。

决定之前,写下你能承受丢失的进度,以及需要保留哪些资源。再去官方计费表核对区域、平台、卡数和 Spot 策略,低价就有了具体使用场景。

资料核对与适用范围

2026-10-05重读Nebius计费与抢占VM文档。十GPU小时45/21.5/差23.5美元仅单价算术;60秒通知、卷及本地SSD为文档条件,未租机或中断恢复。

Spot按当前价及策略计费,不保证连续十小时、库存或固定未来价。费用小计不含磁盘网络税费;60秒不能保证程序完成保存,也无可用性亲测。

来源与说明

  1. [1] Nebius 计算资源计费表

    Nebius · 官方资料 · 核对 2026/10/05

    H100 NVLink 按需2026-10-01起 $4.50/GPU小时,此前$3.85;抢占$2.15/GPU小时;平台仅列eu-north1

  2. [2] Nebius抢占VM:通知与数据去向

    Nebius · 官方资料 · 核对 2026/10/05

    可随时停机,60秒SIGTERM后强制停止;按当前Spot价格及策略;附加卷保留,本地SSD停止丢失,动态IP释放;无保证可用性