> ## Documentation Index
> Fetch the complete documentation index at: https://docs.tuneplane.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 任务集与 Agent 评估

> 发布独立任务集，准备可复现的 Harbor 评估。

**任务集**位于资产菜单，**Agent 评估**位于评估菜单。任务集定义要做的工作及训练／评估划分；环境定义 Agent 在哪里执行动作；Harbor 为每个 trial 组织 Agent、沙箱和验证器。同一任务集可以用于不同模型和执行环境。

## 发布固定版本任务集

将 Harbor 任务目录放在共同根目录下。每个任务必须有 `task.toml`，目录名即任务 ID，且不得重复。

```bash theme={"theme":{"light":"github-light","dark":"github-dark-dimmed"}}
tp taskset build ./tasks --split eval
tp taskset push ./tasks --name agent-tasks --version v1
```

`build` 将文件摘要写入 `taskset.json`。混合训练和评估任务时，在发布前修改各任务的 `split`。任务正文发生变化后，需要更新摘要并发布新版本；`build` 不会覆盖已有清单。符号链接、重叠任务目录和路径越界会被拒绝。

控制台显示已封存版本、划分数量和内容摘要，不提供任务正文或参考答案下载。私有版本仅对有权限的用户可见。作业使用 `owner/name@version` 引用固定版本，不接受浮动版本。本地容器作业通过 `TUNEPLANE_JOB_TASKSET_DIR` 获得只读挂载；其他后端暂不支持独立任务集分发。

划分标签用于选择评估任务，不会对有权限作业内的任意代码隐藏文件。如果需要独立控制测试集访问权限，应将其发布为单独任务集。

## 准备 Harbor 评估

打开 **Agent 评估**，或从任务集版本进入，填写：

* 已封存的任务集版本，仅运行其中的评估任务。
* 托管模型端点和固定模型版本。
* 运行镜像实际支持的 Docker 或 E2B 沙箱后端。
* 运行环境与评估框架的 SHA-256 标识、重复次数、并发数及单次超时。

页面校验请求后，可下载 `harbor-evaluation.json`，此时尚未启动作业。使用 `tuneplane-examples` 中的 `harbor-eval` 实验，将配置放在项目根目录，按实验 README 操作。`--check-plan` 可以在不加载 Harbor、不创建沙箱的情况下校验本地任务内容。平台提交使用 `tp submit --taskset`，指定已配置的本地资源配置和固定运行镜像。

## 容量与结果

一个请求最多规划 10,000 个 trial，并发上限为 256。未选择[沙箱池](/zh-Hans/console/sandbox-pools)时，这仅是单个作业的限制；实际容量由运行环境和服务商决定。Docker 访问能力或 E2B 凭据需要在运行侧配置，页面选择后端不会自动完成部署。

基础设施错误会停止接纳新 trial。协作取消会等待已启动 trial 清理后保存部分结果；强制终止后的清理仍依赖服务商 TTL 和巡检回收。所有规划结果都进入覆盖率分母，缺失或未评分结果不会记作成功。默认不采集轨迹正文。结果同时携带任务集、验证器内容、运行环境、评估框架及实际执行配置，用于判断可比性。

运行环境和框架摘要是用户声明，不代表后端已通过认证。共享池容量与租约已可通过沙箱池页面管理；控制台启动和历史记录、真实服务商认证仍需单独建设。
