← 返回归档

Meta-Harness: End-to-End Optimization of Model Harnesses

一、论文摘要

大型语言模型(LLM)系统的性能不仅取决于模型权重,还取决于其harness(支架):决定存储、检索和向模型呈现什么信息的代码。然而,harness目前主要仍由手工设计,现有的文本优化器不太适合这一场景,因为它们过于激进地压缩反馈:它们是无记忆的、仅基于标量分数条件化、或将反馈限制在短模板或摘要中。

本文介绍了Meta-Harness,一个搜索LLM应用的harness代码的外循环系统。它使用一个代理式提议器(agentic proposer),通过文件系统访问所有先前候选者的源代码、分数和执行轨迹。在在线文本分类任务上,Meta-Harness在4倍更少上下文tokens的情况下,比最先进的上下文管理系统ACE提升了7.7个百分点。在检索增强的数学推理任务上,单个发现的harness在五个保留模型上平均提升了200个IMO级问题的准确率4.7个百分点。在代理式编程任务上,发现的harness在TerminalBench-2上超越了最佳手工工程基线。这些结果表明,更丰富地访问先前经验可以实现自动化的harness工程。


二、基本信息

  • 论文 ID: 2603.28052
  • 标题: Meta-Harness: End-to-End Optimization of Model Harnesses
  • 作者:
    • Yoonho Lee (Stanford)
    • Roshen Nair (Stanford)
    • Qizheng Zhang (Stanford)
    • Kangwook Lee (KRAFTON)
    • Omar Khattab (MIT)
    • Chelsea Finn (Stanford)
  • 会议/期刊: COLM 2026 Conference
  • 原文保存位置: ~/.openclaw/workspace/papers/20260328_MetaHarness/source/
  • 报告生成日期: 2026-04-16

三、论文主体分析

1 Introduction

在固定的大型语言模型周围改变harness可以在同一基准测试上产生6倍的性能差距。harness——决定存储、检索和向模型展示什么的代码——往往与模型本身同等重要。这种敏感性导致了对harness工程日益增长的兴趣,即改进LLM周围的代码以提高整体系统性能的实践。尽管其重要性,harness工程仍主要是手工进行的:从业者检查失败、调整启发式规则,并在少量设计上迭代。

本文探讨了这个过程本身是否可以自动化。一个自然的起点是最近的文本优化工作,因为harness工程也涉及使用先前尝试的反馈迭代改进文本和代码制品。然而,这些方法不太适合harness工程,因为它们通常操作于短视或严重压缩的反馈:一些仅基于当前候选者条件化,其他主要依赖标量分数,还有一些将反馈限制在短模板或LLM生成的摘要。这是一个务实的大规模选择,而不是证明长程依赖不具信息性。

harness在长视距上行动:关于存储什么、何时检索、如何呈现的单个选择可以在许多推理步骤后影响行为。压缩的反馈往往删除了将下游失败追溯到早期harness决策所需的信息。在代表性文本优化器研究的任务中,每个优化步骤的可用上下文范围仅从100到30,000个tokens(表1),远低于harness搜索的诊断足迹。更广泛地说,关于检索和记忆增强语言模型的工作表明,有用的上下文通常应该自适应访问,而不是整体打包到单个提示中。

本文通过Meta-Harness解决这一局限性,这是一个通过端到端搜索优化harness的代理式harness。其提议器是一个编码代理,即一个可以调用开发者工具和修改代码的语言模型系统。选择编码代理(而不是原始LLM)很重要,因为经验量很快超过上下文限制,所以提议器必须决定检查什么并通过与代码库的直接交互验证编辑。其关键设计选择是通过文件系统暴露完整历史,使提议器能够选择性诊断原始先前代码和执行轨迹,而不是从压缩的每个候选者摘要进行优化。

对于每个先前候选者harness,文件系统存储源代码、评估分数和执行轨迹,提议器通过标准操作如grepcat检索它们,而不是将它们作为单个提示摄入。在实践中,在最苛刻的设置中,提议器在每次迭代中读取中位数82个文件,每步引用超过20个先前候选者。在我们研究的设置中,单次评估可以产生高达10,000,000个tokens的诊断信息,大约比先前文本优化设置中使用的最大反馈预算大三个数量级。

本文在在线文本分类、数学推理和代理式编程三个任务域上评估Meta-Harness。在在线文本分类上,Meta-Harness发现的harness在使用4倍更少上下文tokens的情况下,比ACE提升了7.7个百分点,并且在仅4次提议后匹配了下一个最佳文本优化器的最终性能。在检索增强的数学推理上,单个发现的harness在五个保留模型上平均提高了200个IMO级问题的准确率4.7个百分点。在TerminalBench-2上,发现的harness超越了Terminus-KIRA,并在所有Haiku 4.5代理中排名第一。

图1: (左)在文本分类上,Meta-Harness超越了最佳先前手工设计的harness(ACE)和现有文本优化器(TTT-Discover, OpenEvolve),在仅4次评估后匹配下一个最佳方法的最终准确率。(右)在TerminalBench-2上,Meta-Harness超越了所有报告的Claude Haiku 4.5 harness。

图1: (左)在文本分类上,Meta-Harness超越了最佳先前手工设计的harness(ACE)和现有文本优化器(TTT-Discover, OpenEvolve),在仅4次评估后匹配下一个最佳方法的最终准确率。(右)在TerminalBench-2上,Meta-Harness超越了所有报告的Claude Haiku 4.5 harness。

:::

图2: Meta-Harness搜索循环。(1)代理读取包含所有先前候选者源代码、执行轨迹和分数的文件系统,并提出新harness。(2)在评估任务上评估提议的harness。(3)所有日志(提议的代码、推理轨迹、评估分数)存储在文件系统中的新目录中,循环重复。

图2: Meta-Harness搜索循环。(1)代理读取包含所有先前候选者源代码、执行轨迹和分数的文件系统,并提出新harness。(2)在评估任务上评估提议的harness。(3)所有日志(提议的代码、推理轨迹、评估分数)存储在文件系统中的新目录中,循环重复。

:::

表1: 文本优化方法及其设置的比较

方法 历史 日志内容 MTok/iter
OPRO Window 过往(solution, score)对 0.002
TextGrad Last 当前制品的文本反馈 0.015
AlphaEvolve Window 程序数据库 + 评估分数 0.022
GEPA Summary rollout轨迹的反思性反馈 0.008
Feedback Descent Summary 比较 + 文本反馈 0.012
TTT-Discover Window 先前solution片段 0.026
Meta-Harness Full 所有日志和分数 10.0

注:每行代表跨任务折叠的方法。MTok/iter是我们对每篇论文考虑的最大设置中,一次文本制品评估产生的完整上下文的最佳估计。本文考虑每次制品评估产生数量级更多上下文的设置。


2 Related Work

从高层次看,Meta-Harness将更广泛的信用分配和元学习文献中的思想引入了一个新的范式,这一范式由编码代理的最新进展所启用。系统不在harness层面分配信用:它使用过去rollout的经验来刻意推理哪些步骤和组件负责失败,然后重写控制未来行为的外部代码。更具体地说,该方法位于几个最近研究线程的交汇点;它与自适应访问外部上下文、可执行代码搜索和文本优化的工作最直接相关。

外部记忆和自适应访问。 几项先前工作指出将大型知识源或长输入视为语言模型自适应访问的外部资源的好处,而不是一次性消费它们。具体来说,检索增强生成、交错检索和推理、基于记忆的代理或递归语言模型是自适应访问外部上下文的机制。Meta-Harness使用类似的访问模式,但在harness工程这一更苛刻的设置中,提议器选择性检查大量外部代码、分数和执行轨迹历史,以改进上下文管理过程本身。

可执行代码搜索。 最近的方法搜索函数、工作流或代理设计的可执行代码。早期工作提出使用大型模型作为进化程序搜索中的变异和交叉算子。后来的方法在固定程序支架中进化指定函数,使用元代理从先前发现中编程新代理,或搜索代理系统的工作流图。另一条工作线搜索持续学习代理的记忆设计,其中记忆跨任务流持久化。相比之下,Meta-Harness搜索域特定harness,包括提示构建、检索和状态更新策略,这些策略在任务间重置。其外循环刻意最小化:不依赖固定支架、先前发现的归档或持久记忆机制,它给提议器无限制的文件系统访问先前经验。这使代理能够决定检查什么信息,并能够搜索完整harness实现而非预定义的上下文管理过程空间。

文本优化方法。 Meta-Harness也与ProTeGi、TextGrad、OPRO、GEPA、AlphaEvolve/OpenEvolve和Feedback Descent等方法密切相关,这些方法使用先前尝试的反馈迭代改进提示或其他文本制品。然而,这些方法不太适合harness工程,其中优化目标是完整的可执行过程,相关的环境反馈分布在代码、分数和执行轨迹中,难以预先总结。Meta-Harness中的提议器不是仅对聚合分数或摘要做出反应;它可以推理失败示例及其执行轨迹,以提出针对性编辑。


3 Meta-Harness: A Harness for Optimizing Harnesses

本节描述Meta-Harness,搜索任务特定harness的外循环过程。Meta-Harness建立在harness优化受益于允许提议器通过文件系统访问选择性检查先前代码和执行轨迹的想法之上,而不是从有损摘要或额外的手工设计搜索结构进行优化。从高层次看,它重复提议、评估和记录新harness。

Meta-Harness本身也是一种广义的harness(因此得名),因为它确定提议器模型在搜索期间看到什么信息。除非另有说明,我们使用harness指代正在优化的任务特定程序。

目标。 harness是一个有状态程序,包装语言模型并确定模型每步看到什么上下文。目标很简单:找到使底层模型在目标任务分布上表现最佳的harness。形式上,令$M$表示固定语言模型,$\mathcal{X}$表示任务分布。对于harness $H$和任务实例$x \sim \mathcal{X}$,我们执行rollout轨迹$\tau \sim p_M(H, x)$。harness为$M$构建提示,模型响应,harness在每次交互后更新其状态。任务特定奖励函数$r(\tau, x)$对轨迹评分。harness优化的目标是找到最大化期望最终奖励的harness:

$$ H^* = \argmax_{H} \mathbb{E}_{x \sim \mathcal{X}, \tau \sim p_M(H, x)} \; r(\tau, x) $$

当多个目标相关(如准确率和上下文成本)时,我们在帕累托优势下评估候选者并报告结果前沿。在实践中,这种搜索传统上由人类工程师和研究人员进行,他们手工迭代改进提示、上下文管理规则和工具使用逻辑。

Meta-Harness搜索循环。 Meta-Harness使用单个编码代理提议器,访问增长的文件系统$\mathcal{D}$作为其反馈通道。这里,编码代理是一个可以调用开发者工具和修改代码的语言模型系统。与将改进逻辑外化于手工设计搜索循环的先前系统不同,Meta-Harness将诊断和提议委托给编码代理本身:它决定检查哪些先前制品、哪些失败模式需要解决,以及是否进行局部编辑或更实质性的重写。等效地,提议器不是在外循环组装的固定提示上操作的原始下一个token模型;它是一个代理,作为搜索本身的一部分检索信息、导航先前制品和编辑代码。

每个评估的harness贡献一个包含其源代码、分数和执行轨迹(如提示、工具调用、模型输出和状态更新)的目录。文件系统通常远大于提议器的上下文窗口,所以提议器通过终端工具如grepcat查询它,而不是将其作为单个提示摄入。每次迭代时,提议器首先检查先前代码、分数和执行轨迹,然后在生成新harness前推理可能的失败模式。

Meta-Harness维护种群$\mathcal{H}$和评估harness的帕累托前沿,但不施加父选择规则:提议器可以自由检查任何先前harness及其执行轨迹来提出新harness。我们运行固定次数迭代的进化,并在帕累托前沿上进行最终测试集评估。这种简化是刻意的:通过将诊断和编辑决策留给提议器而非硬编码搜索启发式,Meta-Harness可以随着编码代理变得更强大而自动改进。提议器从未看到测试集结果;其唯一反馈来自搜索集,用于在搜索期间评估候选harness并生成改进反馈信号的任务实例子集,以及在这些搜索运行期间记录的执行轨迹。

代码空间搜索的优势。 harness优化发生在代码空间,其中对检索、记忆或提示构建逻辑的小改动可以在许多步骤后影响行为,使局部搜索启发式不太适合问题。通过检查执行轨迹,提议器往往可以推断harness为什么失败以及哪些早期设计选择可能导致了失败,而不仅仅是它失败了,如附录中的搜索轨迹所示。那里我们看到提议器广泛阅读先前代码和日志,然后使用这些轨迹识别混淆编辑、隔离可能的因果变化,并在重复回归后转向更安全的修改。

提议器因此可以在算法结构层面修改harness,从检索、记忆或提示构建逻辑的变化到完整程序重写,而不是填充模板或应用预定义变异算子。在实践中,它往往从强先前harness开始,但这是一种涌现策略而非硬编码规则。虽然搜索空间大,但将harness表示为程序提供了自然的正则化偏差:编码模型倾向于提出连贯算法而非脆弱的硬编码解决方案,这使搜索偏向可重用的上下文管理过程。这个行动空间与前沿编码助手训练的读-写-执行工作流密切相关。

实践实现。 在实验中,每个harness是单文件Python程序,修改任务特定提示、检索、记忆和编排逻辑。提议器$P$是Claude Code,使用Opus-4.6。提议器由最小域特定技能引导,描述在哪里写入新harness、如何检查先前harness及其执行轨迹、以及可以和不能修改什么文件。基础模型$M$因域而异,总是冻结;见第4节实验。在实验中,典型运行在20次迭代中评估大约60个harness。我们在附录中提供在新域实现Meta-Harness的额外提示。

算法1: Meta-Harness harness外循环

输入: 任务 X, LLM M, 提议器 P, 迭代次数 N
初始化: 种群 H // 初始有效harness集合
初始化: 文件系统 D ← ∅ // 存储代码、分数、轨迹

对于 H ∈ H:
  E_H ← Evaluate(H, M, X)
  D ← D ∪ {(H, E_H)}

对于 t = 1 ... N:
  提议器 P 查询文件系统 D // 检查先前harness和分数
  提议器 P 提议 k 个新harness {H_1,...,H_k}
  
  对于 H in {H_1,...,H_k}:
    如果 H 通过接口验证:
      D ← D ∪ {(H, Evaluate(H,M,X))}

返回 D 中存储的harness的帕累托前沿

4 Experiments

本文在三个任务域上评估Meta-Harness:在线文本分类、数学推理和代理式编程。在每个域中,我们使用标准评估指标将Meta-Harness发现的harness与域适当基线进行比较。请参阅每个子节了解精确实验设置。

我们与两类主要方法进行比较。(1)人工设计策略:这些是每个域的手工harness,代表当前最先进的上下文构建。我们在相应子节中描述这些基线。(2)程序搜索方法:这些方法使用反馈和奖励信号搜索候选harness,但设计用于比harness工程更小规模的设置。

4.1 Online Text Classification

本文遵循在线文本分类设置:LLM逐个接收标记示例,更新其记忆,并在保留测试集上评估。使用GPT-OSS-120B作为LLM文本分类器,考虑为文本分类设计harness的问题。使用三个数据集,因其难度和域多样性选择:

  • LawBench (Law): 从案件描述预测刑事指控(215类)
  • Symptom2Disease (S2D): 从症状描述预测疾病(22类)
  • USPTO-50k: 从产物分子预测前体反应物(180类)

从该设置的主要基线harness初始化搜索种群$\mathcal{H}$:零样本、少样本、ACE和MCE。运行20次进化迭代,每次迭代两个候选者,产生40个候选harness。

图3: 在线文本分类上准确率与上下文tokens的帕累托前沿。Meta-Harness实现了比所有比较方法更强的准确率-上下文帕累托前沿。

图3: 在线文本分类上准确率与上下文tokens的帕累托前沿。Meta-Harness实现了比所有比较方法更强的准确率-上下文帕累托前沿。

:::

表2: 所有harness在三个数据集上的测试集指标

Harness USPTO S2D Law Avg Acc Ctx ↓
Zero-Shot 12.0 63.2 7.0 27.4 0
Few-Shot (8) 14.0 67.9 21.0 34.3 2.0
Few-Shot (32) 13.0 72.2 21.0 35.4 7.9
Few-Shot (all) 15.0 78.3 29.0 40.8 12.3
MCE† 14.0 83.0 23.0 40.0 28.5
ACE† 16.0 77.8 29.0 40.9 50.8
Meta-Harness 14.0 86.8 45.0 48.6 11.4

注:Ctx表示上下文中的额外输入tokens(千)。†:来自Ye et al.的实现。↓:越低越好。Meta-Harness在改进在线文本分类准确率的同时使用更小的输入上下文。

与文本优化器比较。 本文将Meta-Harness与代表性文本优化方法进行比较。为公平比较,使用相同提议器配置(Opus-4.6,最大推理),仅基于搜索集性能选择候选者,并在最终评估前保留测试集。由于评估是主要计算瓶颈,给每个方法相同预算的提议harness评估。考虑以下比较点:

  • Best-of-N: 从种子独立采样,无搜索结构;计算匹配控制搜索是否有意义
  • OpenEvolve: 使用LLM变异的程序进化搜索
  • TTT-Discover: 仅使用其文本优化组件,即通过PUCT重用规则的提议选择

在此设置中,Meta-Harness在0.1×评估次数内匹配最佳先前文本优化器(OpenEvolve, TTT-Discover),其最终准确率超过它们超过10个百分点(图1、表3)。本文将此加速归因于对外循环施加最小必要结构的刻意设计选择。特别是,Meta-Harness使用文件系统保留完整经验历史并允许提议器检查任何必要内容,而OpenEvolve和TTT-Discover都比完整文件系统访问操作于更结构化和实质更有限的提议器输入。本文指出在线文本分类是研究的最小上下文设置(表1),所以如果结构重的文本优化器在此滞后,其局限性可能只在更困难范式中增长。

Meta-Harness快10倍且收敛到更好的harness 在此设置中,Meta-Harness在10×更少完整评估次数内匹配最佳先前文本优化器(OpenEvolve, TTT-Discover),其最终准确率超过它们超过10个百分点。

表3: 不同文本优化器提议的harness的文本分类准确率(搜索集)

方法 Median Best
GEPA 32.6 40.2
Best-of-N 34.0 44.2
OpenEvolve 39.1 43.3
TTT-Discover 34.1 45.6
Meta-Harness 50.0 56.7

注:Meta-Harness在harness优化方面显著更有效。

为隔离提议器接口的哪些部分最重要,本文在在线文本分类中比较三种条件:仅分数条件、分数加摘要条件(提议器接收LLM生成的摘要但无原始轨迹)、以及带有执行轨迹访问的完整Meta-Harness接口(表4)。结果显示对完整接口的大差距:仅分数达到34.6中位数和41.3最佳准确率,分数加摘要达到34.9中位数和38.7最佳。相比之下,Meta-Harness达到50.0中位数和56.7最佳准确率,即使其中位数候选者也优于任一消融下发现的最佳候选者。本文将此解释为完整访问执行轨迹是接口最重要组件的证据:摘要不恢复缺失信号,甚至可能因压缩诊断有用细节而损害。

表4: 在线文本分类中提议器可用信息的消融

方法 Scores Code Summ. Traces Median ↑ Best Acc ↑ > ZS
Scores Only 34.6 41.3 26
Scores + Summary 34.9 38.7 23
Meta-Harness (full) - 50.0 56.7 39

注:> ZS:准确率超过零样本基线的运行数。完整Meta-Harness接口显著优于仅分数和分数加摘要消融。访问原始执行轨迹是启用harness搜索的关键要素。

与最先进harness比较。 主要比较点是此问题设置的手工设计harness:Agentic Context Engineering(ACE),使用反思性记忆策展随时间构建上下文;Meta Context Engineering(MCE),维护和演进化上下文构建的自然语言技能库。作为额外基线,评估零样本提示和$N \in \{4, 8, 16, 32, \text{all}\}$示例的少样本提示。表2结果显示Meta-Harness显著改进先前手工设计harness。选择的Meta-Harness达到48.6%准确率,比ACE提升7.7个百分点,比MCE提升8.6个百分点。这些增益不来自使用更多上下文:Meta-Harness仅使用11.4K上下文tokens,而ACE使用50.8K,MCE使用28.5K。

准确率-上下文权衡。 因为Meta-Harness在harness代码上进行自由形式优化,可以表达对准确率和上下文成本的联合偏好,而不是预先承诺单个标量目标。仅给定当前指标和期望权衡,提议器能够发现前沿广泛范围内的harness,在图3中产生平滑的准确率-上下文帕累托曲线。这允许以受控方式交易额外上下文换取更高测试准确率,而不是承诺单个手工设计操作点。

分布外(OOD)任务评估。 本文评估发现的harness是否泛化到搜索期间未见的新数据集。考虑九个多样数据集,在附录中详细描述。选择的Meta-Harness系统达到最佳平均准确率(73.1%),超越ACE(70.2%)和所有少样本基线(表5)。值得注意的是,观察到在$32$之外天真添加更多少样本示例在7/9任务中损害性能。Meta-Harness在6/9数据集上显示最高性能,表明发现的harness捕获了文本分类的一般有效策略,而非过度拟合搜索期间使用的特定数据集。

表5: OOD文本分类数据集评估

Harness SciC FiNER Amz5 FPB GoEmo Bank77 News SciT TwHate Avg Acc Ctx ↓
Zero-shot 32.7 56.0 52.7 90.0 42.0 80.7 84.7 89.3 75.3 67.0 -
Few-shot (8) 34.0 63.0 54.0 90.0 44.0 82.7 84.7 91.3 76.7 68.9 2.2
Few-shot (32) 38.7 62.0 53.3 90.7 43.3 86.0 85.3 90.7 76.7 69.6 5.2
Few-shot (all) 35.3 61.0 50.0 93.3 42.7 80.7 84.0 90.0 76.7 68.2 7.4
ACE 40.7 74.0 48.0 96.7 44.0 83.3 86.0 90.7 68.7 70.2 11.7
Meta-Harness 53.3 67.0 60.0 94.0 46.0 82.7 86.7 91.3 77.3 73.1 7.3

注:Meta-Harness在这9个先前未见任务上超越下一个最佳方法2.9个百分点。

4.2 Harnesses for Retrieval-Augmented Reasoning

本文研究奥林匹克数学求解的一个非标准设置:增强模型从大型语料库检索示例的能力。原则上有充分理由预期检索有助于数学推理,因为解决方案往往共享可重用证明模式,所以先前推理轨迹包含模型可能在推理时利用的信息。然而检索尚未成为此设置的标准成分,先前工作表明它在推理密集数学基准测试上远不如在更事实接地域成功。困难在于天真检索很少以正确形式呈现正确轨迹。这表明成功较少取决于添加检索本身,而更多取决于发现正确的检索策略。与其手工设计该策略,本文给Meta-Harness一组困难的奥林匹克问题,允许检索行为本身从搜索中涌现。

检索语料库包含来自八个开源数据集的≥500,000个已解决问题。仔细去重和去污染它对评估基准测试和搜索集,确认保留问题在我们的字符串过滤下无精确前缀匹配,并手工检查保留示例的顶级BM25检索。使用Meta-Harness在250个奥林匹克难度数学问题(OlympiadBench + Omni-MATH hard)的搜索集上优化harness 40次迭代,产生109个候选检索harness。从该设置的主要基线harness初始化搜索种群$\mathcal{H}$:零样本、少样本和ACE。基于使用GPT-OSS-20B的搜索集性能选择单个harness。

在200个先前未见IMO级问题(来自IMO-AnswerBench、IMO-ProofBench和ArXivMath)上评估此harness。除GPT-OSS-20B外,在搜索期间未见的四个模型上评估相同检索harness:GPT-5.4-nano、GPT-5.4-mini、Gemini-3.1-Flash-Lite和Gemini-3-Flash。遵循先前工作的标准评估协议,报告每个问题三个样本的平均准确率。

结果。 表6比较发现的harness与无检索、使用独立嵌入模型text-embedding-3-small的稠密检索、随机少样本提示和BM25检索。相比之下,Meta-Harness完全在代码空间操作,在相同基于BM25的词汇检索栈之上,而非引入额外稠密编码器。

发现的检索harness在所有五个保留模型上超越无检索基线,平均增益4.7个百分点。它还平均匹配或超越最强固定基线,总体上超越BM25检索1.3个百分点,同时避免稠密检索和随机少样本提示在多个模型中观察到的回归。

表6: 200个IMO级问题上的检索增强数学问题求解

方法 GPT-5.4n GPT-5.4m Gem-3.1FL Gem-3F GPT-20B Avg.
No Retriever 23.0 28.8 28.6 42.6 47.6 34.1
Dense Retrieval (k=1) 27.1 (+4.1) 24.5 (-4.3) 31.3 (+2.7) 42.3 (-0.3) 46.9 (-0.7) 34.4 (+0.3)
Dense Retrieval (k=5) 31.1 (+8.1) 28.3 (-0.5) 37.1 (+8.5) 47.2 (+4.6) 46.7 (-0.9) 38.1 (+4.0)
Random Few-shot 23.1 (+0.1) 24.5 (-4.3) 31.0 (+2.4) 40.4 (-2.2) 41.8 (-5.8) 32.2 (-1.9)
BM25 Retrieval 30.2 (+7.2) 29.2 (+0.4) 32.8 (+4.2) 46.6 (+4.0) 48.9 (+1.3) 37.5 (+3.4)
Meta-Harness 31.7 (+8.7) 30.4 (+1.6) 34.9 (+6.3) 46.3 (+3.7) 50.6 (+3.0) 38.8 (+4.7)

注:每个问题三个样本的pass@1平均,括号内为相对于基线的绝对改进。发现的Meta-Harness检索策略在所有五个保留模型上改进这些IMO级问题的推理,平均增益4.7个百分点。

Meta-Harness改进IMO级数学问题的推理 在检索增强数学推理中,单个发现的检索harness跨五个保留模型传递,平均比无检索改进4.7个百分点,并在比较方法中产生最强的总体平均。

4.3 Evaluating Agentic Coding Harnesses on TerminalBench-2

TerminalBench-2评估LLM代理在89个挑战性任务上,需要长视距、完全自主执行、复杂依赖和实质域知识。先前工作表明代理harness的选择对此基准测试性能有很大影响。从两个强开放基线初始化搜索:Terminus 2和Terminus-KIRA。对于此实验,在相同89任务基准测试上进行搜索和最终评估。将此基准测试用作发现问题,目标是发现改进性能的harness配置。这是标准实践:公开文档已经描述TerminalBench本身上重复基准测试特定harness迭代,基准测试小且昂贵,引入单独分割会实质性削弱搜索信号。此外通过手工检查和基于正则的任务特定字符串泄漏审计来检查过度拟合。

结果。 表7报告完整基准测试的结果,在两个基础模型上评估:Claude Opus 4.6和Claude Haiku 4.5。在Opus 4.6上,Meta-Harness发现达到76.4%通过率的harness,超越手工工程Terminus-KIRA(74.7%),在TerminalBench-2排行榜上所有Opus 4.6代理中排名#2。唯一更高分数的Opus 4.6代理是ForgeCode(81.8%);然而,无法仅从公开可用代码重现其报告结果,表明其排行榜分数取决于超越发布仓库的组件。

在更弱的Haiku 4.5模型上,改进更大:Meta-Harness达到37.6%,超越下一个最佳报告代理(Goose, 35.5%)2.1个百分点。TerminalBench-2是积极竞争的基准测试,多团队直接优化它,所以自动搜索方法能在此前沿实现效益对于长视距文本优化循环是鼓舞人心的。

图4: TerminalBench-2排行榜结果。Meta-Harness超越Terminus-KIRA和所有其他Haiku 4.5代理。

图4: TerminalBench-2排行榜结果。Meta-Harness超越Terminus-KIRA和所有其他Haiku 4.5代理。

:::

表7: TerminalBench-2通过率

Harness Auto Pass (%)
Claude Opus 4.6
Claude Code 58.0
Terminus 2 62.9
Mux 66.5
Droid 69.9
TongAgents 71.9
MAYA-V2 72.1
Terminus-KIRA 74.7
Capy 75.3
ForgeCode 81.8
Meta-Harness 76.4
Claude Haiku 4.5
OpenHands 13.9
Claude Code 27.5
Terminus 2 28.3
Mini-SWE-Agent 29.8
Terminus-KIRA 33.7
Goose 35.5
Meta-Harness 37.6

注:其他结果来自官方排行榜。Meta-Harness在所有Opus-4.6代理中排名#2,在所有Haiku-4.5代理中排名#1。

提议器的定性行为。 harness搜索轨迹帮助解释为什么Meta-Harness实现这些增益;附录提供详细总结。在早期迭代中,提议器将合理结构修复与提示模板编辑组合,观察到两个候选者都回归。然后明确假设回归被共享提示干预混淆,将结构变化与提示重写隔离,最终转向更安全的加性修改,成为运行中的最佳候选者。这提供定性证据文件系统访问使提议器能够以足够详细检查先前经验以形成因果假设并相应修订harness

Meta-Harness在TerminalBench-2上超越手工工程代理 在TerminalBench-2上,Meta-Harness自动发现的harness在Opus 4.6上超越Terminus-KIRA,在所有Haiku 4.5代理中排名#1。


5 Discussion

超越超越现有harness,Meta-Harness有几个实践优势。发现的harness泛化到分布外分类数据集(表5)和数学设置中未见基础模型(表6)。搜索运行在几小时墙上时间完成,但产生可读、可传递的策略,可在模型间重用,包括未来更强的模型。代码空间过度拟合也更可检查:脆弱的if链或硬编码类映射在检查时可见,而权重空间过度拟合则不可见。

更广泛地说,结果表明Meta-Harness的主要优势不仅是代码搜索,而是带有选择性访问先前诊断经验的搜索。提议器不限于标量奖励或固定摘要;它可以检查原始代码、执行轨迹和先前失败,然后使用该信息形成和测试改变什么的假设。附录中的定性搜索轨迹直接说明此行为。

发现反映了机器学习中的循环模式:一旦搜索空间变得可访问,更强的通用代理可以超越手工工程解决方案。未来工作的自然下一步是共同进化harness和模型权重,让策略塑造模型学习什么反之亦然。虽然评估三个多样域,实验证明harness搜索可以与一个特别强的编码代理提议器(Claude Code)一起工作;提议器代理间效果如何变化的更广泛研究留给未来工作。


四、论文简评

创新点

  1. 文件系统驱动的完整历史访问: Meta-Harness的核心创新在于通过文件系统暴露所有先前候选者的完整历史(源代码、分数、执行轨迹),而非压缩的摘要或标量分数。这使提议器能够选择性诊断失败原因,而非仅知道"失败了"。

  2. 代理式编码代理作为提议器: 使用编码代理而非原始LLM作为提议器,使系统能够通过工具(如grep、cat)自主决定检查什么内容,验证编辑,并导航大型代码库。这与固定提示上的标准文本优化器根本不同。

  3. 最小化外循环结构: Meta-Harness刻意最小化外循环结构,不施加父选择规则、固定支架或预定义变异算子,将诊断和编辑决策完全委托给提议器。这使系统能随着编码代理改进而自动提升。

  4. 跨域泛化验证: 论文在三个不同域(文本分类、数学推理、代理编程)上验证方法,发现的harness在未见数据集和模型上均显示强泛化能力,证明并非过度拟合特定设置。

  5. 帕累托前沿优化: 支持多目标(准确率、上下文成本)的联合优化,自动发现帕累托前沿而非单一操作点,提供灵活的权衡选择。

局限性

  1. 提议器依赖: 所有实验使用Claude Code(Opus-4.6)作为提议器。对其他编码代理的效果如何变化未充分研究,可能强依赖特定代理能力。

  2. 计算成本: 单次评估可产生高达10M tokens的诊断信息,虽然比文本优化器大3个数量级,但也意味着高计算和存储成本。典型运行需约60次评估。

  3. 基准测试争议: TerminalBench-2实验将基准测试用作发现问题(搜索和评估相同),存在过度拟合风险。虽通过手工检查和正则审计缓解,但非理想设置。

  4. 搜索集规模: 搜索集规模小(分类50-100示例,数学250问题),可能限制搜索信号强度。如何扩展到更大规模未明确讨论。

  5. harness初始化: 实验从强基线harness(ACE、Terminus-KIRA)初始化搜索种群。从零开始的效果未充分评估,可能依赖良好起点。

应用场景

  1. LLM系统工程: 为需要优化上下文管理、检索策略、工具编排的LLM应用(聊天机器人、代码助手、知识问答)提供自动化工程流程。

  2. 竞争性基准测试: 在积极竞争的基准测试(如TerminalBench)上快速发现改进配置,减少手工迭代时间。

  3. 模型无关优化: 发现的harness可跨模型传递,适用于需要支持多模型的平台(如API提供商、框架开发者)。

  4. 检索增强系统: 为数学推理、科学研究等检索敏感任务自动发现有效检索策略,而非手工调参。

  5. 低成本部署: 发现的harness在使用更少上下文tokens的同时实现更高准确率,适合成本敏感的生产部署。

可改进方向

  1. harness-模型联合优化: 探索harness和模型权重的共同进化,让策略塑造模型学习,反之亦然。

  2. 提议器多样化研究: 系统研究不同编码代理(Gemini Code Assist、GitHub Copilot、开源代理)的效果差异,理解对提议器能力的依赖程度。

  3. 大规模搜索集: 研究如何扩展到更大搜索集(1000+问题),可能需要分层搜索或更高效评估。

  4. 在线持续学习: 结合持续学习框架,使harness能随新任务和数据持续进化,而非一次性搜索。

  5. 可解释性增强: 提供工具可视化提议器的决策过程(为什么检查某些文件、如何形成因果假设),提升系统可理解和可控性。

  6. 多模态扩展: 将方法扩展到多模态harness(图像、视频、音频),优化视觉语言模型的上下文管理策略。

  7. 安全性约束: 集成安全约束(如防止泄露敏感信息、遵守伦理准则),使发现的harness满足生产安全要求。


五、关键数据与结果总结

性能改进汇总

任务域 基线 Meta-Harness 改进 上下文节省
文本分类(LawBench等) ACE: 40.9% 48.6% +7.7pp 4× fewer tokens
数学推理(IMO级) No retrieval: 34.1% 38.8% +4.7pp avg -
TerminalBench-2(Haiku) Goose: 35.5% 37.6% +2.1pp -
TerminalBench-2(Opus) Terminus-KIRA: 74.7% 76.4% +1.7pp -

搜索效率

  • 文本分类: Meta-Harness在4次评估内匹配OpenEvolve/TTT-Discover的最终性能(需60次),快15×
  • 文本分类: 最终准确率比OpenEvolve/TTT-Discover高10+百分点

文件访问统计(TerminalBench-2)

  • 每次迭代读取文件数: 82(中位数),69-99(范围)
  • 文件类型分布:
    • harness源代码: 41%
    • 执行轨迹: 40%
    • 分数/摘要: 6%
    • 其他: 13%

发现的harness特点

文本分类harness:

  • Draft Verification: 两次调用(草稿+验证),检索反例针对性修正
  • Label-Primed Query: 单次大调用,标签primer + 覆盖块 + 对比对

数学检索harness:

  • 四路由词法路由器: 组合、几何、数论、代数/其他
  • 每路由定制检索策略(BM25、去重、难度重排)

TerminalBench-2 harness:

  • 继承Terminus-KIRA核心(原生工具调用、30KB输出上限)
  • 添加环境快照bootstrap(节省2-4探索轮次)

报告生成完毕