Lode 需求雷达
--卡片
--主题
--失败
HN讨论 · 身份未知

寻找可抢到的 GPU Spot 容量:H100 难求,转向 AMD MI350/MI355

有 AI 计算需求的用户在 H100 Spot 池几乎总是满、难以拿到容量时,改用 DigitalOcean 的 AMD MI350/MI355 Spot 实例已稳定运行约一周;用户仍在询问替代方案的回收频率和其他可用的容量来源。

目标用户

需要为 AI 训练/推理租用 GPU Spot 实例的个人开发者或小团队

潜在需求

需要找到当前实际可用的 GPU Spot 容量来源,并了解替代 GPU 型号在 Spot 场景下的真实回收频率与稳定性,以便低成本完成 AI 工作负载。

发生场景

用户试图获取 H100 的 Spot 实例,但所查的 Spot 池几乎总是满载;他最终在 DigitalOcean 上改用 MI350/MI355 并运行约一周未被中断,同时在社区中询问替代方案的回收频率和可用容量来源。

来源证据

发帖者尝试获取 H100 的 Spot 容量,但多个 Spot 池几乎总是满的;改用 DigitalOcean 上的 AMD MI350/MI355 后已运行约一周未被回收,并询问他人实际回收频率。

Is it just me or is GPU capacity surprisingly hard to find right now , even in Spot pools? I’ve been trying to get H100s and the Spot pools I’ve checked are pretty much always full. I ended up trying MI350/MI355s on DigitalOcean Spot and have been running them for about a week without getting interrupted. Curious if anyone else has tried them? How often are you actually getting reclaimed? Also, where are you guys finding capacity these days?
https://news.ycombinator.com/item?id=49403759

为什么值得留意

GPU Spot 容量稀缺会直接影响 AI 工作负载的成本和交付,本信号显示了从 NVIDIA H100 转向 AMD 替代型号的具体采用行为,同时暴露出替代型号回收率数据缺失,可能带来容量发现或替代硬件决策相关的信息与工具需求。

已有方案

  • Vast.ai

未满足部分

  • 关于 AMD MI350/MI355 在 Spot 池中的实际回收频率和稳定性的公开经验分享不足

可能延伸 · 模型推测

  • 实时 GPU Spot 容量与价格发现工具(推测)
  • 替代 GPU 型号 Spot 回收率监测或社区数据聚合(推测)

目前未知

  • 原帖只有一条评论,样本量小
  • 发帖者身份与动机未知,不能确认其为独立最终用户
  • H100 Spot 容量紧张是否普遍存在有待验证

继续核实

  • H100 及主流 GPU 的 Spot 容量紧张在当前市场是否普遍?
  • MI350/MI355 在 DigitalOcean 及其他平台上的实际回收率如何?
  • 用户对于 GPU Spot 容量发现工具的需求是否真实存在?

主题词

gpu capacityspot instancescloud gpu rentalalternative gpu hardware

管理令牌