GaiaAdapter 将 GAIA 数据行转换为标准 Task。官方执行入口是 qit bench run,而 examples/benchmarks/gaia_eval.py 现在只是同一套官方结果契约上的薄封装。
准备工作
1
安装基准测试依赖
2
认证 HuggingFace
GAIA 是受限数据集。先在 huggingface.co/datasets/gaia-benchmark/GAIA 申请访问,再设置:
3
设置模型 API key
加载任务
运行评测
优先使用官方命令行:examples/benchmarks/gaia_eval.py。
运行单个任务:
智能体结构
评测脚本会构造一个 ReAct 风格的网页研究智能体,通常组合:- 浏览器工具
- 文件读取
- 命令执行
ReActTextParser
Task,你也可以替换成自己的 AgentModule。
检查结果
GAIA 结果文件通常包含:task_idquestionreference_answerpredictionstop_reasonstepslatency_secondstrace_run_dir
qita 检查:
