Harness¶
Harness 最核心的演化逻辑如下:
Harness 的本质一直没变——它是“让一个不够可控的对象,在一个可控环境中工作”的工程结构。
附录:Harness 的时间线¶
1980s 之前/左右
软件测试中形成 test harness 概念:
用 stubs、drivers、测试数据、测试环境来隔离和验证软件模块。
1988
IEEE 文献中已经出现 “test harness for maintaining unfamiliar software” 这类用法。
2022
EleutherAI 的 lm-evaluation-harness 在大模型评测中普及:
harness = 统一评测框架。
2024
SWE-bench 进入软件工程评测:
harness = Docker 化、可复现的 patch 评估环境。
2025
Coding agent 快速发展:
Codex、Claude Code、Aider、Cline、OpenHands、SWE-agent 等需要更强的运行环境、工具、状态和反馈控制。
2026-02
OpenAI Ryan Lopopolo 发表 Harness Engineering 文章:
harness engineering 被明确推到 agent-first software engineering 语境。
2026-03
LangChain 用 “Agent = Model + Harness” 明确表达 agent harness:
harness = 模型之外的代码、配置、工具、状态、执行逻辑。
2026-05
AI Harness Engineering 被论文进一步形式化:
harness = foundation-model software agents 的 runtime substrate。