跳转到主要内容

这是本节的多页打印视图。 .

返回本页常规视图.

产品

了解三个交付物、两条评测路径、设计原则、历史和当前限制。

Harbor Self-Evolving 为 DeepSeek Harness 增加持续评测与受控自进化,由三个部分协作交付:

  • DSH Plugin:原生工具、Workbench、Host 服务与权限边界。
  • evolve-agent-with-harbor Skill:由本项目维护的官方编排策略。
  • Python Adapter:Harbor Generator、Evaluator、Optimizer 接线与确定性 Gate 集成。

从 Dataset 到元评测

插件不是只调用一个 Judge,而是把完整评测闭环拆成可治理角色:

角色插件如何支持
Dataset(评测数据集)校验 Task、instruction、路径与 source digest;区分用于修复的训练数据、用于选择方案的验证数据和最终 holdout。
Generator(生成器)Adapter 在冻结的 Candidate、model binding、Context 与 Host/Docker 环境中运行 Agent,保存 output 与 Artifact。
Evaluator(评估器)统一 script / llm-as-judge 接口,按 criterion 记录 Evidence、validity、abstention 与 coverage。
Optimizer(优化器)Skill 和 Agent 从 Trial 证据提出一个受审改动;它不拥有评分、Gate 或部署权限。
Meta-Evaluation(元评测)用独立 Ground Truth 检查 Evaluator 的 fidelity、calibration 与 ranking reliability,防止用一把未经验证的尺子优化 Agent。

机器学习中的训练集、验证集和测试集不是三种文件格式,而是三种信息边界:用于修改 Candidate 的 case 已经是训练信息;反复用于选方案的数据会成为验证信息;只有在最终运行前未向 Optimizer 暴露答案的 holdout,才适合估计泛化。详见核心概念与可信分数与Evaluator 治理。

两条评测路径

路径从哪里开始回答什么问题可作为晋级证据?
Historical 诊断最近完成的 DSH Session当前 Agent 失败在哪里?否,仅诊断
Candidate 回归冻结的 Candidate + Dataset + Stack + Context单个受控改动在可比证据上是否更好?满足 policy 与 Gate 条件时可以
双路径评测模型

Skill

内置 Skill 选择摩擦最小且安全的路径:没有 Dataset 时使用最近 Session;用户提供 Candidate 后进入严格流水线。昂贵执行前先固定身份,从 typed evidence 读取结果,并且从不把 Gate 当作部署权限。

Adapter

Python 包 harbor-dsh-evolution 把 DSH Candidate 与 Task 映射到 Harbor 评测接口。0.9.7 使用 Candidate Context v3 和 Historical Context v2,Web Workbench 可识别两种当前合约。Host 为默认执行环境,Docker 为显式 opt-in。

设计原则

  1. 先身份,后分数。
  2. 先有效性与 coverage,后平均值。
  3. 每轮只做一个受控改动。
  4. 证据和 policy 与优化器分离。
  5. Gate 建议与部署分离。
  6. 在动作发生处披露权限与 provider 边界。

状态与路线图

**0.9.7 已交付:**包安装、19 个 Agent 工具、Workbench、Historical 诊断、Evaluator 治理、Host-first 执行、Candidate Context v3/Historical Context v2 Web 支持,以及绑定完整安装身份的审阅式更新命令。

**已撤回预览:**未打 tag 的浏览器一键更新已在发布前移除。浏览器不会执行 registry 包;用户在终端检查并运行精确 setup 命令。

**路线图:**持久化操作恢复、强化 mutation 授权、retention/GC、更安全的外部 Artifact 预览,以及更完整的浏览器与无障碍覆盖。

警告

Same-origin 是浏览器 CSRF 防线,不是 caller authentication。Host 执行不是沙箱;Gate 只是固定输入下的确定性建议,不具有部署权限。

从原型到 0.9.7

  • **0.1–0.8:**建立 Candidate/Dataset/Stack 模型、评测循环与 DSH 集成。
  • **0.9.0–0.9.4:**原生 Workbench、Historical Session 冷启动、受审动作、上下文与证据导航。
  • **0.9.5:**合并 Workbench,并强化发布证据。
  • **0.9.6:**Host-first 执行,Docker 显式 opt-in,同时保留安全边界。
  • **0.9.7:**修复当前 Context Web 合约、保留更新身份,并发布双语产品与文档站。

每个正式版本的证据与限制见发布。

1 - DSH 原生评测工作台

完整介绍 DSH Plugin 的 19 个工具、Workbench、Host 服务、受审动作与当前限制。

npm 包 dsh-harbor-evolution 不只是工具注册表,它承担五层职责:

  1. 安装生命周期:配置选定 DSH profile,安装 Python Adapter,暴露内置 Skill,并要求重启。
  2. Agent 编排:注册 19 个带 typed boundary 与批准语义的严格工具。
  3. 原生 Web 体验:Workbench、Historical 启动器、Context、Evidence、Artifact、operation 与 Settings。
  4. Host 服务:限量读取 project/job、选择 Session、代理模型调用、协调后台操作。
  5. 信任边界:脱敏、same-origin 浏览器检查、显式确认和不可信证据 envelope。
DSH Plugin 职责层

工具面

Plugin 注册 19 个工具。10 个 mutation 工具需要 DSH 一次性批准;9 个为只读或内存操作。逐工具契约见工具参考。

Workbench

Web 体验把严格流水线带进 DSH:

  • Dashboard 与 Job/Trial 状态;
  • Pipeline stage 与 preflight;
  • Context、可比 baseline 与 Gate readiness;
  • Trial 输出、criterion evidence 与 artifact;
  • Historical Session 选择与披露;
  • 受审动作草稿、确定性 preflight 与显式确认;
  • 后台 operation 与恢复状态;
  • Settings、执行环境和版本 UI。
合成 Harbor Workbench

上下文与受审动作

普通聊天仍是普通聊天。@harbor 页面上下文解析短期、owner-bound 引用;typed Evidence ref 再强制 Workspace → Job → Trial → Criterion → Evidence 祖先关系。Artifact 文本始终是不可信数据。

Ask AI 可以准备 proposal draft,但不能写文件、启动 Job、修改 Evaluator、运行 Gate 或部署。用户必须另行检查确定性 preflight,并确认精确动作。

当前限制

0.9.7 已接受 Candidate Context v3,并按 protocol 显式识别 Historical Context v2。Candidate Compare/Gate 仍要求可比 baseline、有效 Artifact、promotion-eligible mode 与 policy;支持该流程不代表一定返回 PROMOTE。

警告

Same-origin 检查是浏览器 CSRF 防线,不是 caller authentication。Historical Web operation 锁为进程内状态,而部分 durable @harbor snapshot 可超过内存 TTL;retention 与恢复能力因 operation 而异。

早期未打 tag 的一键更新预览已在发布前撤回。0.9.7 只做版本检查,并且仅在完整安装身份可用时展示精确可复制的 setup 命令;浏览器不会执行 registry 包。