/deployments,与带 TTL 的 Playground session
相互独立。每个 deployment 有稳定端点、不可变 revision 和自己可吊销的令牌。挂起会释放 GPU 并保留
身份。

受管部署及其 revision 与端点。
创建部署
创建向导分四步:名称、模型来源、运行配置、确认。
然后选 vLLM 或 SGLang,以及塑造它的那些参数:GPU 数、dtype、量化、上下文长度、并发、
显存利用率,以及调用方要写的模型名。引擎专属字段在你选定引擎之后出现。
参数是一份类型化白名单。没有自由形式的 shell 参数字段,所以你在这里填的任何东西都不会变成引擎
进程上的一个额外 flag。
状态与自愈
状态依次为Deploying、Warming、Ready,异常时显示 Degraded 或 Failed,暂停后为 Suspended。Ready 表示运行时存活、健康检查成功、/v1/models 包含预期模型名,并完成最小生成预热。
单副本运行时丢失或连续健康检查失败后,控制器会按退避策略重建。暂停会停止运行时并释放 GPU;恢复会基于当前 Revision 重新创建。
调用稳定端点
创建部署后只显示一次初始 Token。后续可在 设置 → 部署 Token 创建、撤销或轮换 Token。Responses API
Ready 部署同时保证 OpenAI Responses API 的创建与 SSE 流式输出可用。稳定网关也允许 GET、POST 和 DELETE,因此查询、取消、删除、input items 等辅助端点会按引擎原生能力透传;当前 vLLM 基线保证创建、查询和取消,较新的 SGLang 还提供更完整的状态端点。response_id / conversation_id 可能失效;需要跨重建持久化的应用应保存完整 input items,并以 store: false 调用。
OpenAI 托管的 web search、file search、code interpreter 等内置工具不会由本地引擎自动获得;函数工具、reasoning 和结构化输出能力取决于模型、引擎版本及所选 parser。