最近AI圈爆火的 Harness Engineering,到底是什么?
前言
最近缺项目经历想快速提升项目实战能力(包含多个AI项目),或者最近找工作,或者想学习AI的小伙伴,可以看看下面👇🏻的这个链接(或许真的能够帮到你)。
2026年如果你还不知道Harness是什么,可能真的就out了。
它正在取代提示词工程,成为硅谷乃至全球最流行的AI工程化范式。
腾讯、阿里、字节等大厂,已经开启了新一轮AI大基建的筹备,而Harness就是其中关键的一环。
很多小伙伴可能会问:这和那个CI/CD平台Harness是什么关系?
答案是此Harness非彼Harness。
CI/CD的Harness解决的是软件部署的确定性流程问题,而AI圈的Harness Engineering是一门全新的工程学科。
它让AI在真实生产环境中可靠运行的驾驭系统。
今天这篇文章专门跟大家一起聊聊Harness Engineering,希望对你会有所帮助。
一、Harness Engineering诞生史
Harness概念真正引爆行业,源于2026年2月OpenAI的一篇技术博客**《Harness Engineering: Leveraging Codex in an Agent-First World》**。
实验中,一个仅由3名工程师(后扩展到7人)组成的团队,在5个月内用Codex Agent生成了超过100万行生产级代码,合并了约1500个Pull Request,没有一行代码是人类手写的。
实验中早期进展比预想要慢,不是因为Codex不行,而是因为运行环境定义得不够充分——智能体缺少实现高层目标所需的工具、抽象和内部结构。
由此,AI工程化范式完成了从“怎么对AI说话”到“怎么构建AI生存环境”的三次跃迁。

二、Harness究竟是什么?
Harness一词源自英文“马具”——套在马身上让它能拉车干活的整套装备。
LangChain工程师Vivek Trivedy给出了公认最干净的定义:
Agent = Model + Harness通俗比喻:模型是引擎,Harness是整车:
- Prompt Engineering好比给引擎调校油门响应速度——重要但不是核心
- Context Engineering相当于给引擎配上导航仪和行车电脑
- Harness Engineering则是把引擎装进整车——底盘、方向盘、刹车、仪表盘、安全气囊全部就位
腾讯集团副总裁李强也用赛车做了比喻:赛车的引擎相当于模型服务,底盘是Agent基础设施,遥测系统是数据治理,操控系统是技能生态,坐在驾驶舱的赛车手是Agent应用本身。发动机决定上限,Harness决定能不能跑、跑多远、跑多稳。
三、Harness如何运作?
Harness如何驱动Agent,需要先理解核心执行引擎——Agent Loop。
CLI交互运行后的底层执行包含5步:
- 加载项目上下文 (skills + CLAUDE.md);
- 拼装提示词(系统角色+工具定义+用户任务);
- 模型推理发起工具调用;
- 工具调度执行Bash、文件读写;
- 结果折叠回上下文进入下一轮循环。

这个过程会持续循环,直到任务完成或超出循环次数限制。
Think-Act-Observe-Repeat是Harness的核心执行循环。
Orchestrator本身被刻意设计得极其**“愚蠢”**——只负责驱动循环、执行工具调用、感知结果;所有的推理、决策、何时停止,全部交给大模型自己决定。
运行时越笨,架构越稳定。

Harness通过**Plan Mode(规划模式)与Execute Mode(执行模式)**隔离机制进一步稳定执行——长链路任务先只做方案输出,不碰任何文件,由人类审核后,再切换到执行模式,批准后才开始实际代码改动和Shell命令执行。
四、Harness的六大核心模块
Claude Code 51万行Harness源码已被社区全面还原,其架构核心包括以下六大模块:
模块一:多层级System Prompt
现代System Prompt已扩展为超大规模(十余万token)、分层、可缓存的复杂指令集:
- 固定缓存部分:Agent身份、CoT指令、工具Schema、安全策略,占绝大部分,任何改动都会使缓存失效。
- 动态替换部分:会话状态、当前时间、可读取文件列表等。
最近缺项目经历想快速提升项目实战能力(包含多个AI项目),或者最近找工作,或者想学习AI的小伙伴,可以看看下面👇🏻的这个链接(或许真的能够帮到你)。
模块二:Tool Schema
Harness给模型配备的能力边界。工具质量由三个层面决定:
- 内置核心工具:文件读写/编辑、Bash、Web批处理等在模型训练阶段已完成适配。
- 并行工具调用:多工具并行执行可提升速度,但后训练难度极高。
- Bash通用适配器哲学:Claude Code只提供Read、Write、Execute、Connect四种能力原语,Bash作为通用适配器,允许模型组合git、npm等任何开发者工具。

模块三:Context Manager
解决百万Token窗口的高效利用问题。由于大模型计算开销随窗口长度呈平方级增长,有效利用窗口是Harness实际性能的关键。
模块四:Sub-Agent
支持复杂任务拆解的分层强化学习架构。主Agent将任务拆解后派给子Agent执行,更稳妥的方案是让多个子Agent在不同Worktree中并行展开实验。
模块五:Sandbox与权限系统
通过Bubblewrap沙箱和分级权限控制,为AI划定安全边界,实现可观测、可审计、可干预。
模块六:Evaluation Harness
自动化测试、结果验证、质量把关。最巧妙的设计之一是Agent互审——先让评审Agent审查产出,修复后合并提交PR,再由Codex云端进行安全合规整体验证。

五 Harness 如何驱动 Agent?
这个图表清晰地展示了一次任务执行的全貌:

六、国内大厂如何押注Harness?
从腾讯到阿里,从字节到百度,国内大厂已集体认定:Harness是决定AI落地成败的关键。
- 腾讯:高级执行副总裁汤道生指出“AI落地不只是一道算法题,更是一道工程题”。腾讯已开放35000+个开箱即用的Skills,形成完整技能生态。
- 百度:云负责人云周指出“没有模型能支持所有Agent场景”,Harness Engineering正是弥补这一鸿沟的关键路径。
- 阿里:Qoder团队负责人叔同预测未来Agent的核心能力将是自我进化——缺工具就自动编码生成工具。
- 字节:火山引擎总裁谭待也谈道“框架必须与模型协同进化”,旗下ArkClaw智能体体系可支撑多模态与复杂任务闭环执行。
七、AI工程三阶段演进对照表
| 阶段 | 核心问题 | 关注层面 | 人类角色 | 失效模式 |
|---|---|---|---|---|
| Prompt Engineering (2023) | 怎么对AI说话 | 每一次对话 | 指令发出者 | 模型执行偏离预期 |
| Context Engineering (2025) | AI在决策时看到什么 | 会话状态与信息环境 | 上下文架构师 | 模型自信地基于错误信息推理 |
| Harness Engineering (2026+) | AI工作在什么约束里 | 系统级环境 | Agent系统设计师 | 指令和上下文都挺好,但跑得久了还是偏 |
八、如何落地Harness?
- 用AGENTS.md统一指挥:项目根目录放AGENTS.md作为顶层说明书,写入架构决策、常用命令、代码规范。
- 固化每一个错误:每当Agent犯错,就把教训永久写入AGENTS.md或Skill文件,而不是口头纠正。
- 学会用Sub-Agent并行:复杂任务拆给子Agent在独立环境并行执行,提高效率。
- 远程会话恢复:通过
claude -c无缝接续上次任务,避免每次从零开始。
九、优缺点与适用场景
核心优点
- 解决规模化之后的可靠性问题。非确定性系统无法靠预测来实现工程可靠性,Harness通过工程化约束从根本上堵住了失控风险。
- 大幅提升AI应用运行效率。OpenAI数据显示,仅更换Harness架构,Terminal-Bench 2.0通过率从52.8%拉到了66.5%。
- 工程飞轮效应:每一次Agent犯错→固化→Harness变强→错误率下降→任务完成率提升→可以接手更复杂的任务。
- 可观测、可审计、可干预。
现实挑战
- 极高工程复杂度:Claude Code的Harness至少分布在6个大模块,互相串联,改一处必须全链路校验。
- 与模型能力的本质博弈:新一代大模型自带更强推理能力,可能会吃掉部分Harness的控制逻辑,但外部管控仍然不可或缺。
- High‑level抽象与维护代价高。
适用场景
- 从零打造的复杂AI应用(强烈推荐):边界清晰、无历史包袱。
- 高安全、高合规领域的自动化系统:Harness提供严格的沙盒安全边界。
- 需要多智能体协作的大型项目。
- 做企业级AI落地的基础设施构建:从“有模型就行”升级到“有Harness才能大规模交付”。
十、总结
AI工程化范式的三次跃迁,本质是问题视野的逐层扩大。
Harness Engineering这门学科处理的是**“不确定性系统”的工程可靠性问题**,将工程师的角色从手工作坊的指令官,转变为设计规则、驾驭系统的总架构师。
今天的大模型已经够强,可以参与研发交付;但没有Harness,它充其量是个高级玩具;有了Harness,它才能成为研发链路中可靠的协作者。
而程序员也会从“亲手写出每一行代码”,转向“定义目标、卡住边界、掌控节奏、验收结果”。
从马具到整车,Harness正在成为AI时代真正的工程底座。
未来的竞争焦点已经明确:从“谁的模型更强”,转向“谁能把Harness搭得更稳”。
最近缺项目经历想快速提升项目实战能力(包含多个AI项目),或者最近找工作,或者想学习AI的小伙伴,可以看看下面👇🏻的这个链接(或许真的能够帮到你)。