AI Agent 前沿研究週報 W31:成功之外要會守規則與診斷(HANDBOOK.md、ORCA-bench)

AI Agent 前沿研究週報 W31:成功之外要會守規則與診斷(HANDBOOK.md、ORCA-bench)

中文 EN

本文研究窗口為 2026-07-27 至 2026-08-02(Asia/Taipei)。W31 的研究共同指出:任務成功率只覆蓋 Agent 可靠性的一小部分。長期政策、含糊情境、跨訊號診斷與高風險對話,才是部署時最容易失真的能力。

HANDBOOK.md:政策放進上下文,不代表 Agent 會遵守

HANDBOOK.md 把約百頁企業手冊放入 Agent 環境,測試它是否能在五類企業工作中持續遵守 standing instructions。這比單次問答更貼近真實組織:規則可能離當前動作很遠,還會與工具輸出及局部目標競爭注意力。

研究的價值在於把「長上下文」改寫為「長上下文中的可執行約束」。限制是環境與評分仍是人工設計,不能直接外推到每家公司。實務上應把關鍵政策轉成執行前 gate,而不是只期待模型記住手冊。

ORCA-bench:會寫程式,不等於會值 on-call

ORCA-bench 建立含 Prometheus、Jaeger、OpenSearch、原始碼及六天遙測的微服務系統,共 1,079 個 root-cause tasks。五個前沿 Agent 在 realistic medium 設定的最佳 RCA accuracy 僅 25.3%,hard 為 10.0%;人類複評與 LLM judge 的加權 Cohen's κ 為 0.90。

這是強烈但仍有限的證據:50GB 的公開測試床比真實生產環境小且更靜態。作者也將結果視為所需工程投資的下界。部署 SRE Agent 時,應先做唯讀證據收集、時間窗校準與假說排序,再把修復留給明確核准流程。

PatientAgentBench:高風險對話不能只評答案

PatientAgentBench 把基礎模型包進具有醫療工具的 sandbox,與模擬病人對話,並以六個面向、逾百項臨床標準評估。它補上醫療 benchmark 長期偏重知識題、忽略對話和代理動作的缺口。

但模擬病人與 LLM-as-a-Jury 仍可能掩蓋真實族群差異與稀有傷害。這類結果適合做上線前缺口發現,不足以取代臨床驗證、責任分工與人工升級。

研究判斷

三項工作共同把 Agent 評估從「完成沒有」推向「是否遵守、是否找到正確證據、是否在高風險處停下」。下一代評測應同時記錄成功、違規、不可逆動作、校準與人工介入成本。

Watchlist

  • HANDBOOK.md 在動態政策更新、規則衝突與更長任務上的表現。
  • ORCA-bench 是否加入修復動作、事故協作與跨服務變更。
  • PatientAgentBench 的真人、跨語言與弱勢族群驗證。
  • benchmark 是否公開 agent harness、提示、工具錯誤與完整 traces。
  • 把 abstention 與 policy gates 納入企業驗收標準。