如何让AI编程从赌运气变成可复现,Universal AI Harness Framework怎么做到?
在AI编程越来越普及的今天,很多开发者都遇到过同样的挫败:让AI写一段代码,结果像开盲盒。今天写得不错,明天换个对话框就跑偏;上周审查通过的逻辑,这周复现时却完全不记得当初为什么这么写。
这种“赌运气”的开发方式正在成为AI时代最大的隐形成本。而 Universal AI Harness Framework(简称 Harness)正是为了解决这个问题而生。它把AI编程从依赖提示词的随机行为,变成一套可定义、可审查、可重复的工程体系。
AI编程的三大核心痛点
大多数人用AI写代码时,都会遇到以下三个无法回避的问题:
- 行为不可控:LLM在没有明确边界时,倾向于“自作聪明”。你说“优化这个查询”,它可能直接把整个 service 重构了。
- 过程不可审查:代码写出来了,但你不知道AI当时的决策依据是什么。出了bug也无法追溯。
- 上下文不可持久:对话一换、项目一切,之前的规则、偏好、安全边界全部失效,需要反复提醒。
这些问题用更强的提示词很难根本解决。因为提示词是临时的,而工程需要的是持久的约束。
Harness 的价值就在于:它把这些约束从“对话”搬到了“环境”里,让Agent进入项目就像进入一个规则清晰的工厂,知道从哪开始、能做什么、做到什么程度才算完成。
Harness 的核心理念:文件即契约
Harness 最核心的设计是“文件即契约”。所有重要的规则、边界、决策都不再依赖人脑记忆或聊天记录,而是以普通文件的形式固化下来。
具体包括以下几类关键文件:
- AGENTS.md:仓库级入口文档,Agent 进入项目第一件事就是读它,明确整体目标、原则和禁区。
- .aiassistant/rules/*.md:硬性约束规则,例如“禁止直接操作生产数据库”“所有数据库变更必须生成迁移文件”。
- docs//.md*:架构决策记录、领域知识、历史上下文,让AI真正“懂”你的业务。
- .task/ 目录:当前具体任务的完整快照,包括需求冻结版本、实现计划、上下文包、审查结论。
这些文件全部可以被 Git 管理、Code Review、CI 检查。它们不再是“给AI看的提示词”,而是真正的工程产物。
明确 Scope:让AI知道“不能做什么”
Harness 在每次编码动作前,都要求先定义 Allowed Scope(允许范围) 和 Forbidden Scope(禁止范围)。
比如一个任务可能是:
- Allowed Scope:仅优化 UserService 中的 queryUserById 方法
- Forbidden Scope:不允许修改任何其他 Service、不允许新增表字段、不允许改变返回结构
一旦Agent的行为超出 Forbidden Scope,系统会立即打断并要求修正。这种机制极大降低了“幻觉式重构”的概率。
任务分级:不搞一刀切的形式主义
不是所有任务都需要走完整流程。Harness 把任务分为三个层级(Tier):
- Tier 1(简单任务):小调整、文档完善、简单修复,只需轻量记录。
- Tier 2(标准任务):常规功能开发,需要完整的需求冻结、计划、执行、审查。
- Tier 3(复杂任务):涉及架构调整、核心模块重构,必须经过多轮审查和完整文档化。
这种分级设计让流程既严谨又灵活,避免了为了形式主义浪费精力。
过程可审查:把决策也纳入版本管理
这是 Harness 最有价值的地方之一。
传统方式里,AI的思考过程只存在于对话记录里,极易丢失。Harness 要求把以下内容全部以结构化文档形式保存在 .task/ 目录下:
- 需求冻结版本(PRD)
- 技术实现计划
- 上下文快照(当时读取了哪些文档)
- 审查意见和结论
- 最终变更影响评估
这些文档让几个月后的你依然能清楚知道:“当初AI为什么这么写?当时的假设是什么?谁review过?基于什么理由通过的?”
这极大提升了代码的长期可维护性,也让团队协作中的AI行为变得透明可控。
如何在团队中落地 Harness?
落地 Harness 并不需要全新工具链,你完全可以用现有技术栈实现:
- 在项目根目录建立统一的
AGENTS.md和.aiassistant/rules/目录; - 制定团队统一的规则模板(安全边界、代码风格、架构原则);
- 每次重要任务都在
.task/下建立独立文件夹,记录全流程; - 将文件审查纳入现有的 Code Review 流程;
- 逐步将历史架构决策、业务知识迁移到
docs/目录,形成企业知识库。
当这些习惯形成后,你会发现:AI 不再是一个“偶尔很聪明但经常犯蠢”的助手,而变成了一个遵守规则、可被训练、可被审计的“工程伙伴”。
从提示词时代到 Harness 工程时代
AI Coding 的上半场拼的是“让AI更聪明”,下半场拼的是“让AI更可控”。
真正拉开差距的,不再是会用多少个Agent,而是:
- 你能否把模糊想法转化为清晰、可执行的工程契约;
- 你能否建立一套机制,让AI这次犯的错下次永远不犯;
- 你能否把AI的行为纳入工程管理体系,而不是游离在体系之外。
Universal AI Harness Framework 正是为这个后半场而设计的。它不是一个新的AI模型,而是一套把AI彻底工程化的方法论。
当你把规则写进文件、把边界定义清楚、把决策记录下来,你会发现:AI编程终于从一场又一场的“赌运气”,变成了可预测、可复现、可规模化的工程能力。
这才是AI真正成为生产力的开始。