安装后消费者证明什么
Python 3.10、3.12 仓库外安装消费者已通过。横向消费者实际产生 12 次请求、
10 次计划修订、9 份不同压缩 receipt;清理后记忆仍存在。脚本模型证明机制,
不证明智能水平。真实模型矩阵单独统计,保留所有未通过结果。
项目发现并推动关闭的缺陷
- 自定义
agent_factory接入拥有资源的统一 composition。 - 持久技能版本替代两套课程私有存储;正文不再隐式截断,Memdir 支持显式删除。
- Artifact 引用属于证据,不作为高权限 developer 指令。
- 子工作区恢复不能覆盖已经授权筛选的会话内容。
- 同 owner 的暂停继续经过 restoring,并持久化新的终态 head。
- 编码 JSON 字符串检查区分转义程序文本与真实私有路径;Session 合同错误不自动推进循环。
- 原生工具预检拒绝也关闭批次槽位;拒绝与执行混合时不重复生成兼容结果。
- 课程修复涉及历史任务标识、报告/检索说明和子 Agent 预算分配;这些仍是应用策略, 不强制变成所有 Agent 的默认行为。
真实 Qwen 实验合同
每课三任务各三轮,并运行 static plan、no-memory、no-skills 对照。Hermes、 Voyager 先学习,再用新进程进行回忆。对照复制学习结束后的同一存储字节, 不包含默认回忆随后写入的新历史。学习种子失败时,不能声称因果收益。 有界验收配置为每任务 24 步/请求、600 秒、10,240 输出 tokens,最多四个独立 项目/重复轮次组并发;公开项目仍保留可配置的 80/80/3600 默认值。没有整个实验 的费用或请求总额度。provider/model 显式配置,不关闭 TLS 校验、不暗中换模型。 矩阵已完成 99 次调用流程:54 次默认任务、18 次前置学习、27 次对照。 未宣称整个课程组通过真实模型资格验证。
这些是小规模、有界教学实验,不是排名,也不能证明动态规划、记忆或技能普遍提升
任务成功率。一次 Voyager 学习因 snapshot 内容被拒绝而未产出最终报告,计为未通过。
最终矩阵的控制器超时和人工干预均为零;Session 触及声明预算仍计为失败。
18 组均保存安装文件 digest。相对于最终源码,真实矩阵候选仅有两处差异:
_action_runtime.py 后续补充混合拒绝/执行批次的兼容结果去重;Hermes Agent
后续明确字面检索与报告字段说明。两项改动通过永久确定性和安装检查,但 99 次矩阵
没有在这些最终改动上重跑,因此不能作为最终源码完整 live 行为的资格证据。
仓库账本提供仅计数的聚合与安装身份文档 digest。早期源码组和全部失败分别保留在
私有存储,不做 best-of 替换;不公开 provider payload、敏感路径或原始日志。
如何检查失败并开展实验
每轮在私有运行目录写入report.json、Session 标识和 canonical trajectory。
使用项目的 inspect 命令,沿模型请求、工具终态、验证、snapshot 和 final 事件
检查事实。将独立检查器与最后真正完成的操作对照,不只看最终文字。
已观察到的结果应分别理解:
- 框架缺陷: 未闭合批次、错误的子输入需要永久反例和框架修复,不能用 prompt 绕过。
- 传输失败: 代码检查通过后仍可能出现
provider_connection_failed;没有最终结果,整轮仍失败。 - 任务失败: 有 final 但数值错误、引用缺失、未检索到记忆或代码未验证,不算成功。
- 预算停止: 循环触及声明上限仍为未通过,不能偷偷扩额或补一轮后覆盖原结果。
scripts/report_agent_design_lab.py 只输出白名单计数,不代表原始数据获得公开许可。
限制仍包括有界合成任务、协作式取消、本地 Docker 而非 VM 隔离、不保证外部效果
exactly-once、Memdir 删除不是多文件事务、技能没有自动签名依赖解析。
这些项目是研究起点,不代表所有可能的 Agent 应用均已取得资格。