Skip to main content
/admin/capacity 上两个标签页,仅管理员。它们本来就是一起读的:一个说硬件有多忙,另一个说到底有 哪些硬件。 旧的 /utilization/fleets 链接都落到这里。?tab=fleets/<fleet-id> 打开某一个 Fleet 的 机器,它们自己就能占满一页。

Utilization 标签页

unschedulable 不等于忙。一张卡落到那里,是因为健康检查发现了待退役的 ECC 或未纠正错误,或者有 平台之外的进程占着它。

Fleets 标签页

一个 Fleet 是由一种后端管理的、已注册的命名机器集合,也是作业或 deployment 被放置到的对象。 这四种清点状态从不互相取整。一个 unknown 的读数什么都不能证明,所以它既不拒绝任何作业、也不 靠兜底准入任何作业,而一个没上报的卡数读作 null 而不是 0。一个连不上的后端不是一个什么都没有 的集群。 发现说的是存在什么。它从不说什么是空闲的。

你能做什么

只有 node Fleet 在这里注册机器。Kubernetes 管它自己的节点,Slurm 管它自己的节点,local 管的 正好是控制台所在那台主机 —— 所以 Join Token、节点凭据和心跳在 node 上有意义,在别处都没有。在一个 kuberay Fleet 上索要一个会被拒绝,而不是产出一条没有东西能兑现的记录。 外部清点是只读的。平台不会 cordon 一个 Kubernetes 节点,也不会 drain 一个 Slurm 分区:一个去改动 别人调度器的控制面,需要一个这个平台还没给出的论证。

下一步

Fleet · 硬件 · 设置