AI Agent 前沿研究週報 W32:長任務的核心是可驗證恢復(Argus、TRAJDEBUG、ORCA-bench)

AI Agent 前沿研究週報 W32:長任務的核心是可驗證恢復(Argus、TRAJDEBUG、ORCA-bench)

中文 EN

本文涵蓋 2026-08-03 至 2026-08-09(Asia/Taipei)。W32 的研究主線很清楚:長任務不是把 context 拉長,而是讓 Agent 能保存狀態、找出最早關鍵錯誤、以驗證器回復,並知道何時升級給人。

Argus:把自我演化放在 runtime

Argus 以 Manager、Planner、Engineer、Reviewer 執行有界 mission,把使用者意圖、操作目標、限制與驗證條件分離。作者報告在七個 GPT-5.5 評測場域中,SWE-Bench Pro 約 78%,Direct Copilot 約 59%,但使用 1.41 倍總 token;成熟波次則降低 solve-input token 與工作時間。

重要點不是宣稱 Agent「會自我進化」,而是模型權重不變,改變的是經驗、技能、驗證器與路由政策,而且只有通過角色審查或 task-native verification 才持久化。限制也明確:系統複雜、比較基線與環境由作者選定,仍需要獨立重跑與成本敏感度分析。

TRAJDEBUG:找最早且仍影響結果的錯誤

TRAJDEBUG 不只標記錯誤步驟,而是追蹤錯誤何時出現、是否被修復、是否仍造成終局失敗。TrajErrBench 包含 486 條人工標註失敗軌跡,來自 Tau2Bench 與 SWE-Bench Pro。這比只看 final answer 更接近工程診斷,因為長軌跡可能同時存在已修復與未修復錯誤。

仍待證明的是跨 domain 泛化:486 條軌跡可支持方法比較,但不足以代表企業中私有工具、非同步副作用和多人介入的全貌。

ORCA-bench:真實 on-call 差距仍大

ORCA-bench 把 50 GB、六天的 metrics、logs、traces、程式碼和 1,079 個根因分析任務放入可操作測試床。論文報告五個前沿 Agent 中,最佳者在 realistic Medium 設定只有 25.3% RCA accuracy,Hard 為 10.0%;這提醒我們,會改 code 不等於能在含噪遙測中安全值班。

這個結果也有限制:公開且固定的微服務遠小於真實企業系統,各任務被隔離調查。因此作者認為差距是下界,而不是生產 readiness 的直接估計。

本週判斷

三篇工作共同把「長任務能力」重寫為恢復能力:持久狀態、明確驗證、關鍵錯誤歸因與升級點。真正可用的 Agent runtime 不是永不犯錯,而是能在副作用擴大前辨識、回滾並留下可審計理由。

Watchlist

  • Argus 的獨立重現、不同模型與總成本比較。
  • TrajErrBench 是否擴展到瀏覽器、資料工程與多 Agent 互動。
  • ORCA-bench 在私有拓撲、動態部署和多人 on-call 下的表現。
  • 驗證器本身失準時,runtime 如何避免錯誤經驗被永久寫入。
  • 「恢復率/錯誤擴散距離」是否成為長任務的標準指標。