> ## Documentation Index
> Fetch the complete documentation index at: https://qitor.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Design Lab：验收事实与限制

> 区分框架正确性、设计机制和真实模型任务效果。

六个课程是可执行的教学项目，不复刻产品内部实现或论文成绩。工具成功不代表
研究结论正确。[课程总览](/zh/tutorials/agent-design-lab)说明框架与应用的分工；
仓库实施账本保留各阶段源码、修复和验证记录。

## 安装后消费者证明什么

| 消费者                        | 实际机制                                       | 不代表                       |
| -------------------------- | ------------------------------------------ | ------------------------- |
| ReAct / PlanAct            | 同一 composition、反馈、多次重规划与静态对照               | Planner 训练或论文成绩           |
| Pi-like / Claude-Code-like | 真实 Docker 修改/检查、独立子 Session 审查、join 和父会话继续 | 产品复刻、恶意代码防作弊证明或文件回滚       |
| Hermes-like                | 重新打开事实/历史、持久流程版本、无正文目录与完整按需加载              | 每次真实任务都能正确选择记忆            |
| Voyager-inspired           | 三个验证程序、持久掌握顺序、依赖加载及新进程组合复用                 | 开放式学习课程、Minecraft 或签名技能市场 |
| 横向组合                       | 安装后的 PlanAct＋持久 notebook＋独立 Pi 工具及实际压缩     | 第二调度器或第二执行内核              |

Python 3.10、3.12 仓库外安装消费者已通过。横向消费者实际产生 12 次请求、
10 次计划修订、9 份不同压缩 receipt；清理后记忆仍存在。脚本模型证明机制，
不证明智能水平。真实模型矩阵单独统计，保留所有未通过结果。

## 项目发现并推动关闭的缺陷

* 自定义 `agent_factory` 接入拥有资源的统一 composition。
* 持久技能版本替代两套课程私有存储；正文不再隐式截断，Memdir 支持显式删除。
* Artifact 引用属于证据，不作为高权限 developer 指令。
* 子工作区恢复不能覆盖已经授权筛选的会话内容。
* 同 owner 的暂停继续经过 restoring，并持久化新的终态 head。
* 编码 JSON 字符串检查区分转义程序文本与真实私有路径；Session 合同错误不自动推进循环。
* 原生工具预检拒绝也关闭批次槽位；拒绝与执行混合时不重复生成兼容结果。
* 课程修复涉及历史任务标识、报告/检索说明和子 Agent 预算分配；这些仍是应用策略，
  不强制变成所有 Agent 的默认行为。

## 真实 Qwen 实验合同

每课三任务各三轮，并运行 static plan、no-memory、no-skills 对照。Hermes、
Voyager 先学习，再用新进程进行回忆。对照复制学习结束后的同一存储字节，
不包含默认回忆随后写入的新历史。学习种子失败时，不能声称因果收益。

有界验收配置为每任务 24 步/请求、600 秒、10,240 输出 tokens，最多四个独立
项目/重复轮次组并发；公开项目仍保留可配置的 80/80/3600 默认值。没有整个实验
的费用或请求总额度。provider/model 显式配置，不关闭 TLS 校验、不暗中换模型。

矩阵已完成 **99 次调用流程**：54 次默认任务、18 次前置学习、27 次对照。
未宣称整个课程组通过真实模型资格验证。

| 项目               | 默认任务通过 / 尝试 | 前置学习  | 对照             |
| ---------------- | ----------- | ----- | -------------- |
| ReAct            | 9 / 9       | 不适用   | 与 PlanAct 共用任务 |
| PlanAct          | 7 / 9       | 不适用   | 静态计划：9 / 9     |
| Pi-like          | 2 / 9       | 不适用   | 未运行            |
| Claude-Code-like | 2 / 9       | 不适用   | 未运行            |
| Hermes-like      | 0 / 9       | 8 / 9 | 禁用记忆：0 / 9     |
| Voyager-inspired | 3 / 9       | 6 / 9 | 禁用技能：1 / 9     |

这些是小规模、有界教学实验，不是排名，也不能证明动态规划、记忆或技能普遍提升
任务成功率。一次 Voyager 学习因 snapshot 内容被拒绝而未产出最终报告，计为未通过。
最终矩阵的控制器超时和人工干预均为零；Session 触及声明预算仍计为失败。

18 组均保存安装文件 digest。相对于最终源码，真实矩阵候选仅有两处差异：
`_action_runtime.py` 后续补充混合拒绝/执行批次的兼容结果去重；Hermes Agent
后续明确字面检索与报告字段说明。两项改动通过永久确定性和安装检查，但 **99 次矩阵
没有在这些最终改动上重跑**，因此不能作为最终源码完整 live 行为的资格证据。

仓库账本提供仅计数的聚合与安装身份文档 digest。早期源码组和全部失败分别保留在
私有存储，不做 best-of 替换；不公开 provider payload、敏感路径或原始日志。

## 如何检查失败并开展实验

每轮在私有运行目录写入 `report.json`、Session 标识和 canonical trajectory。
使用项目的 `inspect` 命令，沿模型请求、工具终态、验证、snapshot 和 final 事件
检查事实。将独立检查器与最后真正完成的操作对照，不只看最终文字。

已观察到的结果应分别理解：

1. **框架缺陷：** 未闭合批次、错误的子输入需要永久反例和框架修复，不能用 prompt 绕过。
2. **传输失败：** 代码检查通过后仍可能出现 `provider_connection_failed`；没有最终结果，整轮仍失败。
3. **任务失败：** 有 final 但数值错误、引用缺失、未检索到记忆或代码未验证，不算成功。
4. **预算停止：** 循环触及声明上限仍为未通过，不能偷偷扩额或补一轮后覆盖原结果。

原始轨迹可能包含模型输出、源码和私有信息，必须留在 Git 外。
`scripts/report_agent_design_lab.py` 只输出白名单计数，不代表原始数据获得公开许可。

限制仍包括有界合成任务、协作式取消、本地 Docker 而非 VM 隔离、不保证外部效果
exactly-once、Memdir 删除不是多文件事务、技能没有自动签名依赖解析。
这些项目是研究起点，不代表所有可能的 Agent 应用均已取得资格。
