> ## Documentation Index
> Fetch the complete documentation index at: https://docs.tuneplane.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 部署

> 带稳定端点、不可变 revision 和独立令牌的长期内部服务，在 `/deployments`。

长期的内部服务，在 `/deployments`，与带 TTL 的 [Playground](/zh-Hans/console/playground) session
相互独立。每个 deployment 有稳定端点、不可变 revision 和自己可吊销的令牌。挂起会释放 GPU 并保留
身份。

<Frame caption="受管部署及其 revision 与端点。">
  <img src="https://mintcdn.com/starforge/GatXR2rI5-_Vm4_H/images/console/deployments.png?fit=max&auto=format&n=GatXR2rI5-_Vm4_H&q=85&s=375c17e21b43920753fe986cd7410b5b" alt="TunePlane model deployments" width="2160" height="1350" data-path="images/console/deployments.png" />
</Frame>

## 创建部署

创建向导分四步：名称、模型来源、运行配置、确认。

| 模型来源               | 说明                                                 |
| ------------------ | -------------------------------------------------- |
| 模型注册表的一个版本         | 常规情况。版本留空表示跟随被升级上去的那个                              |
| 某次运行的 `hf_export`  | 普通 checkpoint 要先 `tp export`                       |
| 一个 Hugging Face 仓库 | 私有仓库用你自己[绑定的凭据](/zh-Hans/integrations/huggingface) |
| 一个魔搭仓库             | 只支持公开仓库                                            |
| 一个共享目录             | 管理员允许过的那些                                          |

然后选 **vLLM** 或 **SGLang**，以及塑造它的那些参数：GPU 数、dtype、量化、上下文长度、并发、
显存利用率，以及调用方要写的模型名。引擎专属字段在你选定引擎之后出现。

参数是一份类型化白名单。没有自由形式的 shell 参数字段，所以你在这里填的任何东西都不会变成引擎
进程上的一个额外 flag。

<Warning>
  `trust_remote_code` 默认关闭。只有管理员明确允许时用户才能开启，因为它会执行模型仓库中的代码。
</Warning>

## 状态与自愈

状态依次为 `Deploying`、`Warming`、`Ready`，异常时显示 `Degraded` 或 `Failed`，暂停后为 `Suspended`。`Ready` 表示运行时存活、健康检查成功、`/v1/models` 包含预期模型名，并完成最小生成预热。

单副本运行时丢失或连续健康检查失败后，控制器会按退避策略重建。暂停会停止运行时并释放 GPU；恢复会基于当前 Revision 重新创建。

## 调用稳定端点

创建部署后只显示一次初始 Token。后续可在 **设置 → 部署 Token** 创建、撤销或轮换 Token。

```bash theme={"theme":{"light":"github-light","dark":"github-dark-dimmed"}}
curl "https://tuneplane.your-company.com/inference/<deployment-id>/v1/chat/completions" \
  -H "Authorization: Bearer $DEPLOYMENT_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"model":"<served-model-name>","messages":[{"role":"user","content":"hello"}]}'
```

浏览器内的 **Playground** 标签使用登录身份测试，不会读取或暴露部署 Token。客户端调用只能使用部署 Token，登录 access token 不能替代它。

### Responses API

Ready 部署同时保证 OpenAI Responses API 的创建与 SSE 流式输出可用。稳定网关也允许 GET、POST 和 DELETE，因此查询、取消、删除、input items 等辅助端点会按引擎原生能力透传；当前 vLLM 基线保证创建、查询和取消，较新的 SGLang 还提供更完整的状态端点。

```bash theme={"theme":{"light":"github-light","dark":"github-dark-dimmed"}}
curl "https://tuneplane.your-company.com/inference/<deployment-id>/v1/responses" \
  -H "Authorization: Bearer $DEPLOYMENT_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"model":"<served-model-name>","input":"你好","stream":true}'
```

Response 与 conversation 状态保存在单副本运行时中。部署自愈、暂停或切换 Revision 后，旧 `response_id` / `conversation_id` 可能失效；需要跨重建持久化的应用应保存完整 input items，并以 `store: false` 调用。

<Note>
  OpenAI 托管的 web search、file search、code interpreter 等内置工具不会由本地引擎自动获得；函数工具、reasoning 和结构化输出能力取决于模型、引擎版本及所选 parser。
</Note>

## 更新与回滚

配置或模型变更会创建新的不可变 Revision。GPU 充足时平台先启动候选 Revision，通过完整预热后再切换稳定端点；候选失败时旧 Revision 继续服务。GPU 不足时必须明确允许维护窗口，平台不会静默中断现有服务。

在 **Revisions** 标签可查看配置快照并回滚。详情页还提供指标、日志和设置。删除部署会停止运行时并立即撤销全部 Token，且不可恢复。

<Warning>
  删除一个 deployment 会停掉它的运行时并立刻吊销每个令牌。这不可撤销。以后还可能要回来的话，改用
  挂起。
</Warning>

## 下一步

[部署一个模型版本](/zh-Hans/guides/deployments) · [Reflow](/zh-Hans/guides/reflow) ·
[模型注册表](/zh-Hans/console/models) · [推理 API](/zh-Hans/api-reference/inference)
