AI Agent 前沿研究週報 W33:真正的變數是介面與軌跡(SWE-Bench ProMax、Recursive Synthesis、TraceSafe)

AI Agent 前沿研究週報 W33:真正的變數是介面與軌跡(SWE-Bench ProMax、Recursive Synthesis、TraceSafe)

中文 EN

本文研究窗口為 2026-08-10 至 2026-08-16(Asia/Taipei)。W33 的研究共同提醒是:Agent 表現不只屬於模型;工具介面、任務分解與整段執行軌跡,都可能改變結論。

從小修補走向大型重構

SWE-Bench ProMax 把 coding agent 推向大型、多語言重構。它的重要性在於擴大任務半徑,但仍需追問 repository 選樣、測試覆蓋、資料污染與成本。高通過率若依賴大量重試,並不等於可預測的生產能力。

介面本身就是實驗條件

The Devil Is in the Interface 研究工具架構如何改變 coding agent 行為。這對 benchmark 很關鍵:相同模型搭配不同檔案 API、shell 回饋或錯誤訊息,可能呈現完全不同能力。比較模型前,必須版本化 harness 與工具契約。

Recursive Synthesis for Long-Horizon Terminal Tasks 則把長任務拆成可合成的子問題。方法若有效,價值會是降低單一路徑失敗;但還需要跨環境、跨模型與固定預算的獨立重跑,確認收益不是更高 token 支出換來的。

Guardrail 必須看完整軌跡

TraceSafe 評估多步 tool-calling trajectory 上的 guardrail。單輪拒答無法涵蓋「每一步看似合理、組合後越權」的風險。更實用的安全測試應量測危險動作攔截率、正常任務誤殺、延遲與恢復路徑。

本週判斷

下一代 Agent 評測的最小單位不是答案,而是「版本化環境中的完整軌跡」。任何能力宣稱都應附 harness、工具 schema、預算、重試政策與失敗分類。

Watchlist

  • ProMax 是否公開污染稽核、完整成本與 per-repo 結果。
  • 介面效應能否在不同模型與 coding harness 重現。
  • Recursive Synthesis 在固定成本下是否仍提升成功率。
  • TraceSafe 是否擴展至 prompt injection、跨 Agent 授權與真實 SaaS 工具。