AI Agent 週報總覽 W25:從模型競賽轉向可部署系統

AI Agent 週報總覽 W25:從模型競賽轉向可部署系統

中文 EN

本文研究窗口是 2026-06-152026-06-21(Asia/Taipei)。本週 AI Agent 的總結可以用一句話說:市場從「模型競賽」轉向「可部署系統競賽」。產業在補 deployment / governance,研究在補 evaluation / memory / skills,開源在補 harness / device control。

本週三篇深度文章:

1. 產業線:agent 被放進平台,而不是只被放進聊天框

OpenAI Partner Network、Databricks Agent Bricks / Unity AI Gateway、Cloudflare Flue、AWS Bedrock AgentCore 與 NVIDIA XR AI,都指向同一件事:agent 要落地,需要 runtime、治理、資料平面、導入夥伴與實體入口。

這意味著 builder 需要少一點「demo mindset」,多一點 deployment checklist:身份、權限、logging、rollback、human review、cost control、資料邊界與插件來源。

2. 研究線:agent 的難題變成系統評測

本週研究最重要的方向不是單點能力,而是系統品質:

  • benchmark 要有 predictive validity;
  • memory 要能拆成可更新的 atomic facts;
  • skill 要能從軌跡挖掘、被檢索、被組合;
  • agent safety 要考慮內部系統與 embodied devices。

如果這些問題不解決,agent 會在長任務裡出現熟悉的失敗模式:看似有進展、實際不可驗證;看似記得、實際記憶漂移;看似能用工具、實際權限過大或不可審計。

3. 開源線:harness、skills、device control 是新的可重用層

Hermes Agent、OpenClaw、Google ADK、browser-harness、agent-device、awesome-agent-skills、azure-skills 等項目顯示:開源正在把 agent 的可重用價值放在「執行外殼」而非單一 prompt。

這也帶來新的風險。桌面、瀏覽器、手機、IoT 與雲端 skill pack 都會碰到憑證、權限、插件來源與 replay safety。開源 agent 的下一個成熟度門檻不是星數,而是安全模型與 release discipline。

本週綜合判斷

AI agent 的競爭正在變成全棧工程問題:

  1. 產業端要證明能部署、治理、採購。
  2. 研究端要證明評測能預測真實行為。
  3. 開源端要證明 harness 和技能能被安全維護。

對產品團隊來說,這週的 actionable conclusion 是:不要只問「我們用哪個模型」。更該問:

  • agent 執行在哪個 runtime?
  • 它能碰哪些資料與工具?
  • 怎麼記憶、怎麼忘記、怎麼更新?
  • 失敗時誰審查、誰 rollback?
  • 評測分數是否能預測真實使用者任務?

Watchlist

  • Agent deployment:OpenAI / Databricks / AWS / Cloudflare 是否出現可複製 reference architecture。
  • Agent evaluation:predictive validity 是否進入主流 benchmark 報告。
  • Agent memory:AtomMem 類方法是否被開源框架採用。
  • Agent skills:SKILL.md mining 與 skill registry 是否成為工程標準。
  • Agent security:browser/device/desktop agent 是否建立更清楚的 permission boundary。