AI2 和华盛顿大学的一项研究针对 Agent 研究中热门的 Harness Evolution 方向展开实验,将其与「多跑几遍」这类简单的 test-time scaling 方法在相同反馈、相近推理预算条件下对比。实验显示,复杂的 Harness Evolution 并未稳定胜过简单方法,且其进化出的 Harness 在未参与优化的新任务上提升甚微,部分收益更接近任务特定适配而非通用 Agent 架构优化。研究还指出,当前部分 Harness Evolution 的性能提升可能源于更多计算而非 Harness 本身优化,未来评估 Agent 系统需以相近推理预算和外部反馈为标准,且应探索更能体现 Harness 价值的任务基准。