1. 必要的时候 考虑 workflow
hardcode 是美丽的。
工业级、高确定性要求的任务,skill 可能不够稳健,尤其是对于基模能力较差的情况。
2. Agent Runtime/平台的核心能力
- 全链路的身份 trace: 谁指派任务,指派了哪个 Agent,授权范围
- 沙箱: 快速创建与销毁,每个任务都享有独立空间
- egress 网关: 沙箱内的 agent 不管理不接触不处理任何秘钥、AK,全部无加密发给网关,网关同一处理鉴权与审计。例如 cloudflare agent sandbox
3. loop engineering
本质是:用一个系统替代原来负责逐轮提示 agent 的人。
| 层次 | 关注的问题 | 例子 |
|---|---|---|
| Prompt Engineering | 这一句话应该怎么问? | 先分析原因,再修改代码 |
| Context Engineering | AI 应该看到什么? | 规范、相关代码、日志、历史决策 |
| Harness Engineering | AI 能使用什么环境? | 文件、终端、浏览器、权限、沙箱 |
| Loop Engineering | 谁触发下一轮,如何验证,何时结束? | 自测失败后自动重试,成功或重试三次依然无法解决后退出 |
它们不是相互替代,而是一层包一层:
Loop
└── Harness
└── Context
└── Prompt
和 Agent Loop 的区别:
- Agent Loop 解决 Agent 内部的问题:下一步干什么
- Loop Engineering 解决宏观的任务层面问题,任务的触发、推进、验收、失败修复、判断完成。
要解决的问题:
- 什么时候启动:(这个其实很水)可以是定时任务、收到 issue/PR
- 什么是目标
- 【重点】反馈:如何验证
- 失败以后如何改变策略
- 如何停止(成功 or 重试一定次数)
