從 Context、Harness 到 Loop:打造 AI 代理產品的三層工法
先說破一件事:所有 agent 產品的核心,都是同一個 while loop。
Claude Code、Manus、開源社群的 OpenClaw……剝開包裝,底層一模一樣:模型讀 context → 決定呼叫哪個工具 → 執行 → 把結果塞回 context → 重複,直到任務完成。這個迴圈本身沒有祕密,十行程式碼就寫得出來。
真正的差別在迴圈外面的三層。這篇拿 DeworkAI 的實作,由內而外走一遍。
第一層:Context Engineering —— 決定每一步的品質
模型每一步的表現,取決於那一刻它看到什麼。Anthropic 對 context engineering 的定義講得很準:找出最小的高訊號 token 集合,最大化你要的結果。
起點是定義 main agent:它是誰、為誰服務、什麼事明確不做。身分不清楚,後面每一層都會歪。
接著是 system prompt 的結構,大致分兩塊:
- 靜態段:身分與準則、工具規格、安全邊界、輸出格式 —— 不隨 session 改變的部分。
- 動態段:長期記憶、MCP 工具清單、用戶偏好、當下日期 —— 會隨時間變的部分。
靜態放前面不是美學,是錢。 LLM 推論有 prefix caching(KV cache):只要前綴完全相同,那段 token 就不用重算,成本與首 token 延遲都大幅下降。動態內容一旦插在前面,後面整段 cache 全毀。
DeworkAI 走得更激進:連動態段也跟著 session 凍結。session 開始時把記憶、工具清單快照下來,整個 session 期間視為穩定前綴 —— 於是幾乎整份 system prompt 都吃得到 cache。代價是 session 中途看不到最新的記憶變化;換到的是快取命中率最大化。對一個要控制推論成本的產品,這一刀是單位經濟的生死線。
第二層:Harness Engineering —— 決定能力邊界
Harness 是 Anthropic 對 Claude Code 那套外殼的稱呼:迴圈之外,讓 agent「能做事」的全部基礎設施。他們關於 long-running agent harness 的文章值得整篇讀完。
我的做法是從 agent 的目標倒推,依序設計:
- 記憶 —— 跨 session 要記住什麼、怎麼取回來。
- 工具 —— 給哪些能力,以及每個工具的權限分級。
- 環境與沙盒 —— 能碰什麼、不能碰什麼。DeworkAI 在這裡做了一個反直覺的決定:拿掉 bash。對非工程師用戶,任意指令執行等於風險無上限;我們改成動作白名單 + 不可逆動作一律人機確認。能力少一點,信任多很多。
- Subagent —— 複雜任務拆給多個子代理,各自帶乾淨的 context 平行處理,再彙整。
- Skill —— 跑過的流程收成可重用的能力,下次一句話叫出來。
這一層做完,agent 開始展現實用性 —— 但還剩最難的一題:沒有人盯著的時候,它可靠嗎?
第三層:Loop Engineering —— 決定無人值守的可靠性
這個詞是 2026 年 6 月才被叫響的:Addy Osmani 的文章、加上 Claude Code 作者 Boris Cherny 那句「I don’t prompt Claude anymore. I have loops that are running.」—— 別再逐回合 prompt 你的 agent,去設計那個 prompt 它的迴圈。
為什麼需要這一層?看兩種架構的光譜:
- 固定流程(每一步寫死):穩定性高,但不會舉一反三 —— 情境一變就斷。
- 彈性 agent(每一步讓模型決定):聰明,但每一步都是機率 —— 單步 90% 正確率,十步之後只剩 35%,錯誤會複利。
Loop engineering 的核心命題是:verifier 是瓶頸,不是模型。生成很便宜,可以一直跑;決定這些動作有沒有產生價值的,是驗收的那一環。
DeworkAI 的答案就是 Supervisor:workflow 執行時,一個獨立角色全程監督 —— 逐關判定通過/不通過並附具體原因、失敗帶著原因退回重做、重試有收斂上限、超過就停下來找人。executor 和 verifier 是分開的兩個角色;Anthropic 後來在自己的 harness 實驗裡得到同一個結論:把做事的 agent 和判定的 agent 分開,是可靠性最有力的槓桿之一。
這也是彈性與穩定的和解方式:讓 agent 保持聰明,把可靠性交給迴圈設計。
三層是疊的,缺一不可
- Context 決定單步品質 —— 每一步看到對的東西。
- Harness 決定能力邊界 —— 能做什麼、不能做什麼。
- Loop 決定千步可靠性 —— 沒人盯著也不出事。
業界有句話總結得好:prompt engineering 讓模型聰明一回合,loop engineering 讓系統可靠一千回合。做 agent demo 只需要第一層;做 agent 產品,三層都得付清。