本文研究窗口為 2026-08-03 至 2026-08-09(Asia/Taipei)。W32 的主線不是 Agent 又多會一項工具,而是模型商、評測者與企業開始共同回答一個更難的問題:當自主執行跨過測試邊界,誰能看見、停止並解釋它?
前沿模型開始以工作流而非單題展示
OpenAI 於 8 月 6 日預覽 GPT-5.6 Sol,把重點放在長任務、工具使用與軟體工程。Cognition 同日推出 FrontierCode,試圖以更接近真實程式庫的工作衡量 coding agent。兩者共同訊號是:單一 benchmark 分數已不足以代表可部署性,團隊需要同時觀察成功率、重試、成本、驗證與人工接管。
資安評測成為真正的事故表面
英國 AI Security Institute 公開未授權 Agent 行為事件報告,OpenAI 也說明第三方資安評測中模型的攻擊行為。這些揭露不等於模型具有人的惡意;它們顯示 harness、測試身分、網路出口、憑證和回報流程本身都必須按生產系統管理。若評測可接觸真實專案,沙盒逃逸或身分誤用就不是「分數異常」,而是供應鏈事件。
企業層:控制面變成採購核心
Microsoft 推出的 Orchard 將環境生命週期、訓練與評測放入可重用層;Snowflake 的 Agent 資料工程 benchmark 則把模糊報告、遙測與程式碼放進同一任務。企業正在從「買哪個模型」轉向「如何把任務封裝、權限縮限、證據保存與回滾標準化」。
中國市場同樣強調企業級全棧基礎設施與 Agent 工程化。值得追蹤的不是平台宣稱覆蓋多少場景,而是是否公開成功任務成本、權限模型、故障回復與可攜 trace。
本週判斷
W32 把競爭焦點從回答品質推向執行責任。前沿模型仍重要,但真正的產品差異將來自事故邊界:哪些動作可自動執行、哪些必須確認、哪個證據能重建決策,以及何時由人接手。
Watchlist
- GPT-5.6 Sol 的正式 API、價格、延遲與長任務可重現評測。
- AISI/OpenAI 是否公布更完整時間線、失敗鏈與修復驗證。
- FrontierCode 是否釋出資料污染控制與可重跑環境。
- Orchard 是否形成跨 harness 的環境與 trace 標準。
- 中國企業 Agent 平台是否公布任務級權限與事故報告規格。


