跳转至

Harness

Harness 最核心的演化逻辑如下:

测试软件的受控环境
评测模型的受控环境
评测代码补丁的受控环境
驱动 Agent 执行任务的受控环境
企业 AI Agent 的工程底座

Harness 的本质一直没变——它是“让一个不够可控的对象,在一个可控环境中工作”的工程结构。

附录:Harness 的时间线

1980s 之前/左右
  软件测试中形成 test harness 概念:
  用 stubs、drivers、测试数据、测试环境来隔离和验证软件模块。

1988
  IEEE 文献中已经出现 “test harness for maintaining unfamiliar software” 这类用法。

2022
  EleutherAI 的 lm-evaluation-harness 在大模型评测中普及:
  harness = 统一评测框架。

2024
  SWE-bench 进入软件工程评测:
  harness = Docker 化、可复现的 patch 评估环境。

2025
  Coding agent 快速发展:
  Codex、Claude Code、Aider、Cline、OpenHands、SWE-agent 等需要更强的运行环境、工具、状态和反馈控制。

2026-02
  OpenAI Ryan Lopopolo 发表 Harness Engineering 文章:
  harness engineering 被明确推到 agent-first software engineering 语境。

2026-03
  LangChain 用 “Agent = Model + Harness” 明确表达 agent harness:
  harness = 模型之外的代码、配置、工具、状态、执行逻辑。

2026-05
  AI Harness Engineering 被论文进一步形式化:
  harness = foundation-model software agents 的 runtime substrate。