Skip to main content
任务集位于资产菜单,Agent 评估位于评估菜单。任务集定义要做的工作及训练/评估划分;环境定义 Agent 在哪里执行动作;Harbor 为每个 trial 组织 Agent、沙箱和验证器。同一任务集可以用于不同模型和执行环境。

发布固定版本任务集

将 Harbor 任务目录放在共同根目录下。每个任务必须有 task.toml,目录名即任务 ID,且不得重复。
build 将文件摘要写入 taskset.json。混合训练和评估任务时,在发布前修改各任务的 split。任务正文发生变化后,需要更新摘要并发布新版本;build 不会覆盖已有清单。符号链接、重叠任务目录和路径越界会被拒绝。 控制台显示已封存版本、划分数量和内容摘要,不提供任务正文或参考答案下载。私有版本仅对有权限的用户可见。作业使用 owner/name@version 引用固定版本,不接受浮动版本。本地容器作业通过 TUNEPLANE_JOB_TASKSET_DIR 获得只读挂载;其他后端暂不支持独立任务集分发。 划分标签用于选择评估任务,不会对有权限作业内的任意代码隐藏文件。如果需要独立控制测试集访问权限,应将其发布为单独任务集。

准备 Harbor 评估

打开 Agent 评估,或从任务集版本进入,填写:
  • 已封存的任务集版本,仅运行其中的评估任务。
  • 托管模型端点和固定模型版本。
  • 运行镜像实际支持的 Docker 或 E2B 沙箱后端。
  • 运行环境与评估框架的 SHA-256 标识、重复次数、并发数及单次超时。
页面校验请求后,可下载 harbor-evaluation.json,此时尚未启动作业。使用 tuneplane-examples 中的 harbor-eval 实验,将配置放在项目根目录,按实验 README 操作。--check-plan 可以在不加载 Harbor、不创建沙箱的情况下校验本地任务内容。平台提交使用 tp submit --taskset,指定已配置的本地资源配置和固定运行镜像。

容量与结果

一个请求最多规划 10,000 个 trial,并发上限为 256。未选择沙箱池时,这仅是单个作业的限制;实际容量由运行环境和服务商决定。Docker 访问能力或 E2B 凭据需要在运行侧配置,页面选择后端不会自动完成部署。 基础设施错误会停止接纳新 trial。协作取消会等待已启动 trial 清理后保存部分结果;强制终止后的清理仍依赖服务商 TTL 和巡检回收。所有规划结果都进入覆盖率分母,缺失或未评分结果不会记作成功。默认不采集轨迹正文。结果同时携带任务集、验证器内容、运行环境、评估框架及实际执行配置,用于判断可比性。 运行环境和框架摘要是用户声明,不代表后端已通过认证。共享池容量与租约已可通过沙箱池页面管理;控制台启动和历史记录、真实服务商认证仍需单独建设。