Skip to main content
长期的内部服务,在 /deployments,与带 TTL 的 Playground session 相互独立。每个 deployment 有稳定端点、不可变 revision 和自己可吊销的令牌。挂起会释放 GPU 并保留 身份。
TunePlane model deployments

受管部署及其 revision 与端点。

创建部署

创建向导分四步:名称、模型来源、运行配置、确认。 然后选 vLLMSGLang,以及塑造它的那些参数:GPU 数、dtype、量化、上下文长度、并发、 显存利用率,以及调用方要写的模型名。引擎专属字段在你选定引擎之后出现。 参数是一份类型化白名单。没有自由形式的 shell 参数字段,所以你在这里填的任何东西都不会变成引擎 进程上的一个额外 flag。
trust_remote_code 默认关闭。只有管理员明确允许时用户才能开启,因为它会执行模型仓库中的代码。

状态与自愈

状态依次为 DeployingWarmingReady,异常时显示 DegradedFailed,暂停后为 SuspendedReady 表示运行时存活、健康检查成功、/v1/models 包含预期模型名,并完成最小生成预热。 单副本运行时丢失或连续健康检查失败后,控制器会按退避策略重建。暂停会停止运行时并释放 GPU;恢复会基于当前 Revision 重新创建。

调用稳定端点

创建部署后只显示一次初始 Token。后续可在 设置 → 部署 Token 创建、撤销或轮换 Token。
浏览器内的 Playground 标签使用登录身份测试,不会读取或暴露部署 Token。客户端调用只能使用部署 Token,登录 access token 不能替代它。

Responses API

Ready 部署同时保证 OpenAI Responses API 的创建与 SSE 流式输出可用。稳定网关也允许 GET、POST 和 DELETE,因此查询、取消、删除、input items 等辅助端点会按引擎原生能力透传;当前 vLLM 基线保证创建、查询和取消,较新的 SGLang 还提供更完整的状态端点。
Response 与 conversation 状态保存在单副本运行时中。部署自愈、暂停或切换 Revision 后,旧 response_id / conversation_id 可能失效;需要跨重建持久化的应用应保存完整 input items,并以 store: false 调用。
OpenAI 托管的 web search、file search、code interpreter 等内置工具不会由本地引擎自动获得;函数工具、reasoning 和结构化输出能力取决于模型、引擎版本及所选 parser。

更新与回滚

配置或模型变更会创建新的不可变 Revision。GPU 充足时平台先启动候选 Revision,通过完整预热后再切换稳定端点;候选失败时旧 Revision 继续服务。GPU 不足时必须明确允许维护窗口,平台不会静默中断现有服务。 Revisions 标签可查看配置快照并回滚。详情页还提供指标、日志和设置。删除部署会停止运行时并立即撤销全部 Token,且不可恢复。
删除一个 deployment 会停掉它的运行时并立刻吊销每个令牌。这不可撤销。以后还可能要回来的话,改用 挂起。

下一步

部署一个模型版本 · Reflow · 模型注册表 · 推理 API