Skip to main content
CyBench 是一个夺旗赛(CTF)风格基准测试,用来评测智能体在安全分析任务上的表现,包括逆向工程、Web 利用、取证和密码学。任务运行在隔离环境中,得分通过比较智能体提交的答案与已知 flag 计算。 QitOS 提供:
  • CyBenchAdapter
  • CyBenchRuntime
  • score_cybench_submission
因此你可以在 QitOS 执行内核上直接运行完整评测流程。

评分模式

准备工作

1

安装基准测试依赖

2

克隆 CyBench 仓库

3

安装 Docker

大多数 CyBench 任务都需要 Docker 启动挑战服务。
4

设置模型 API key

加载任务

一行式加载器:

运行评测

优先使用官方命令行:
然后继续做聚合与检查:
cybench_eval.py 依然保留,但它现在主要承担基准测试专用参考智能体封装器的角色。 运行单个引导任务:
运行非引导模式:
完整基准测试:
CyBench 任务应始终运行在隔离环境中。挑战服务可能会开放端口或执行任意代码;生产评测建议启用 Docker 隔离。

智能体工具集

CyBench 评测智能体通常只注册一组适合 CTF 的最小工具面:
  • CodingToolSet
  • 终端执行
  • SubmitAnswer
如有需要,也可以继续扩展浏览器工具。

评分与结果检查

score_cybench_submission 会统一计算:
  • guided_subtask_score
  • guided_final_score
  • unguided_success
  • exact_matches
  • partial_matches
单条结果通常包含:
  • task_id
  • mode
  • success
  • guided_subtask_score
  • guided_final_score
  • predictions
  • references
  • stop_reason
  • steps
  • latency_seconds
评测结束后,仍然可以直接用:
来检查具体任务的追踪记录。