本文研究窗口是 2026-05-11 到 2026-05-17(Asia/Taipei)。一句話總結本週:Agent 的競爭正在從「模型」搬到「運行它的系統」——交付、治理、評測、以及平台級工具能力開始決定上限。
本週深度文章(同語言):
- 產業 / 新聞: AI Agent 產業週報(News/Deployment)
- 前沿研究: AI Agent 前沿研究週報(Research)
- 開源 / GitHub: AI Agent 開源週報(GitHub/Open Source)
1. 產業線:Deployment Company + Daybreak,把「落地」與「安全」產品化
這週我最強烈的感覺是:模型公司開始承認「API 不會自己落地」。OpenAI 的 Deployment Company 代表一種 forward‑deployed 的交付模式,而 Daybreak 代表把高風險的安全流程包成 agentic harness(可控、可審計、可驗證)。
如果你在企業內做導入,下一步不只要問「模型夠不夠強」,而是要問:
- 權限與審計怎麼做?
- 失敗了怎麼回滾?
- 成本怎麼控?
- 誰負責?
2. 研究線:把 Agent 當成「系統」來評測與訓練
本週的研究訊號很一致:Agent 的評測正在離開「短答案」的舒適圈。
- ExploitGym 讓我們把 exploitation 當成可重放的能力測試(安全領域會逼出更嚴格的 verification)。
- FutureSim 用世界事件重播測 adaptive agents 的校準與長流程行為。
- Orchard 嘗試把 agentic modeling 推向可重複的 recipe 與框架。
- Agent‑ValueBench 把「價值觀偏移」拉到 agent 系統層級討論。
這些工作共同指向:長流程可靠性與可驗證性會成為 agent 成敗的分水嶺。
3. 開源線:MCP 平台化、orchestration 套件化、記憶層基礎設施化
開源線本週的關鍵詞是「平台與治理」:
- GitHub 把 secret scanning 接到 MCP server,讓安全能力變成 agent 的標準路徑。
- orchestration 專案用 plugin/skills 的方式把 multi-agent 工作流商品化。
- memory layer 開始被視為 agent stack 的必要部件,但也把 retention / redaction / audit 的治理問題帶進來。
下週 watchlist(跨三線)
- Daybreak / Trusted Access 類安全 harness 的 access policy 是否能被工程化與審計化?
- 長流程可靠性的 failure mode(文件腐蝕、狀態漂移)是否會促成一波新的 eval/observability tooling?
- MCP 能否成為「平台級能力」的通用載體(不只接工具,而是接安全/合規/治理)?
- 記憶層能否走向可用的治理標準,而不是新的風險?


