01 / DSH PLUGIN
在 Agent 已经工作的地方工作
◇ 原生工具、Workbench、上下文与受审动作
- 19 个严格工具覆盖安装、诊断、评测、治理与 Gate。
- Web UI 展示 Trial、Evidence、Artifact、Operation 与 Settings。
- Agent 侧 mutation 需要一次性批准;读取保持限量与脱敏。
Plugin 把 DSH 交互连接到不可变的 Harbor 评测身份。
可核对的事实
三个交付物,一份契约
每一层都有窄职责,也都有明确的信任边界。
01 / DSH PLUGIN
◇ 原生工具、Workbench、上下文与受审动作
Plugin 把 DSH 交互连接到不可变的 Harbor 评测身份。
02 / BUNDLED SKILL
◇ 识别 → 诊断 → 单次改动 → 回归 → Gate
官方 Skill 由本项目维护,不表示 DeepSeek 官方背书。
03 / PYTHON ADAPTER
◇ Generator · Evaluator · Optimizer · Gate
身份与证据成为可检查 Artifact,而不是宣传文案。
两条入口
预览 DSH 可见历史的限量脱敏投影;披露 Judge 与数据边界;确认;每条 Session 生成一个 Trial。
回归前固定 Candidate,并绑定 Dataset、Evaluation Stack、runtime 与 Context 身份。
通过显式 diff 改进 Agent 或 Evaluator,再运行可比证据。
对固定 Gate 输入,PROMOTE / REJECT 是确定性建议;部署仍由外部 CI/CD 决定。
设计原则
比较前固定 Candidate、Dataset、Evaluation Stack、runtime 与 Context。
无效证据、abstention、coverage 与 raw reward 保持区分。
每轮只有一个受审改动,才能保留归因。
mutation、provider 访问与本地执行分别披露边界。
每个发布主张都回链源码、测试或带标签归档。
晋级建议与生产权限刻意分离。
先讲边界
不是。本项目的 Harbor 指面向 DeepSeek Harness Agent 的评测与受控进化运行时。
不会。Job 完成只是执行状态;有效分数、可比性、策略阈值和 Gate 才决定是否建议晋级。
对固定输入,Gate 逻辑是确定性的;Candidate 与 Judge 模型输出仍可能随机,因此重复 Job 可能不同。
不会。Harbor 产出证据与建议;外部 CI/CD 或人工 owner 保留部署与 Champion 权限。
不是。默认 Host 模式不提供容器隔离、用户切换、网络策略或 CPU/内存限制,任务以当前用户权限直接运行。
不是。官方 Skill 由本项目维护,不表示 DeepSeek 官方背书。
普通安装
npx --yes dsh-harbor-evolution@latest setup --project-root "$PWD"请在业务 Agent 工作区运行;源码安装仅供贡献者使用。
从你已经拥有的证据开始。评测最近完成的 Session,或带上明确 Candidate 与 Dataset 运行可比回归。