本文研究窗口是 2026-06-15 到 2026-06-21(Asia/Taipei)。本週 AI Agent 的總結可以用一句話說:市場從「模型競賽」轉向「可部署系統競賽」。產業在補 deployment / governance,研究在補 evaluation / memory / skills,開源在補 harness / device control。
本週三篇深度文章:
- 產業 / 產品 / 部署:AI Agent 產業週報 W25:部署平台、治理與實體入口同時升溫
- 前沿研究:AI Agent 前沿研究週報 W25:評測有效性、記憶與技能路由成為主戰場
- GitHub / 開源:AI Agent 開源週報 W25:Harness、技能與裝置控制成為開源焦點
1. 產業線:agent 被放進平台,而不是只被放進聊天框
OpenAI Partner Network、Databricks Agent Bricks / Unity AI Gateway、Cloudflare Flue、AWS Bedrock AgentCore 與 NVIDIA XR AI,都指向同一件事:agent 要落地,需要 runtime、治理、資料平面、導入夥伴與實體入口。
這意味著 builder 需要少一點「demo mindset」,多一點 deployment checklist:身份、權限、logging、rollback、human review、cost control、資料邊界與插件來源。
2. 研究線:agent 的難題變成系統評測
本週研究最重要的方向不是單點能力,而是系統品質:
- benchmark 要有 predictive validity;
- memory 要能拆成可更新的 atomic facts;
- skill 要能從軌跡挖掘、被檢索、被組合;
- agent safety 要考慮內部系統與 embodied devices。
如果這些問題不解決,agent 會在長任務裡出現熟悉的失敗模式:看似有進展、實際不可驗證;看似記得、實際記憶漂移;看似能用工具、實際權限過大或不可審計。
3. 開源線:harness、skills、device control 是新的可重用層
Hermes Agent、OpenClaw、Google ADK、browser-harness、agent-device、awesome-agent-skills、azure-skills 等項目顯示:開源正在把 agent 的可重用價值放在「執行外殼」而非單一 prompt。
這也帶來新的風險。桌面、瀏覽器、手機、IoT 與雲端 skill pack 都會碰到憑證、權限、插件來源與 replay safety。開源 agent 的下一個成熟度門檻不是星數,而是安全模型與 release discipline。
本週綜合判斷
AI agent 的競爭正在變成全棧工程問題:
- 產業端要證明能部署、治理、採購。
- 研究端要證明評測能預測真實行為。
- 開源端要證明 harness 和技能能被安全維護。
對產品團隊來說,這週的 actionable conclusion 是:不要只問「我們用哪個模型」。更該問:
- agent 執行在哪個 runtime?
- 它能碰哪些資料與工具?
- 怎麼記憶、怎麼忘記、怎麼更新?
- 失敗時誰審查、誰 rollback?
- 評測分數是否能預測真實使用者任務?
Watchlist
- Agent deployment:OpenAI / Databricks / AWS / Cloudflare 是否出現可複製 reference architecture。
- Agent evaluation:predictive validity 是否進入主流 benchmark 報告。
- Agent memory:AtomMem 類方法是否被開源框架採用。
- Agent skills:SKILL.md mining 與 skill registry 是否成為工程標準。
- Agent security:browser/device/desktop agent 是否建立更清楚的 permission boundary。


