TauBenchAdapter- 自包含运行时
TauRuntimeEnv
tau_bench 包,就可以直接运行该基准测试。TauRuntimeEnv 提供了自包含的运行时环境。
可用环境
准备工作
Tau-Bench 的任务数据已经内置于 QitOS 包中,无需额外下载。
加载任务
运行评测
优先使用官方命令行:tau_bench_eval.py 依然保留,但它现在只是同一套官方结果结构与追踪记录契约上的基准测试封装器。
运行单个任务:
运行时如何工作
TauRuntimeEnv 提供了最小可替换的 reset / step / calculate_reward 接口。奖励通过重放真实动作序列并比较最终状态哈希来计算。
智能体只有在工具调用引起了正确状态转移、且文本回复中包含了要求的输出值时,才会得到 1.0。
检查结果
典型结果 JSONL 会记录:task_idtrialenvrewardsuccessstop_reasonstepslatency_seconds
qita 检查具体运行:
