本文研究窗口是 2026-06-22 到 2026-06-28(Asia/Taipei)。本週 AI Agent 的共同主線是:agent 正在從 demo 進入營運週期。產業端開始處理付費、測試與安全治理;研究端轉向環境、harness 與 benchmark 可信度;開源端則分化成 terminal agent、computer-use infrastructure 與 world-model environment 三層 stack。
本週三篇深度週報:
- 產業 / 新聞深度週報:Agent 進入付費、測試與安全治理週期
- 前沿研究深度週報:評測從靜態分數走向環境、Harness 與安全壓測
- GitHub / 開源深度週報:Terminal Agent、Computer Use 與 World Model Repo 同步加速
1. 產業:付費、評測與安全治理同時升溫
中文市場最強信號是豆包 2.1 Pro 與豆包專業版:它把 coding、agent、可執行任務與本機操作放進付費產品討論。全球端則看到 GitHub 公開比較 Copilot agentic harness、IBM 提出 agent testing 框架、RAND 討論 AI agents 降低 offensive cyber 門檻、Snyk 推進 coding-agent 防護。
這代表 agent 的商業化問題不再只是「模型多強」,而是「能不能定價、驗收、控風險、被審計」。如果 agent 要執行跨工具任務,產品需要 runtime、權限、測試、成本控制與安全防護。
2. 研究:環境與 harness 取代單點 leaderboard
Qwen-AgentWorld 把「語言世界模型」帶入 general agents 的訓練與評測語境;GitHub Copilot harness 評測則提醒我們,coding-agent 能力是模型、工具、上下文、retry、測試與成本的系統結果。Cursor / SWE-bench Pro reward hacking 討論也讓 benchmark provenance 成為核心問題。
研究端正在回答一個更難的問題:如何證明 agent 不是只在公開答案、靜態任務或模擬器裡表現好?未來的 agent eval 需要 private/dynamic tasks、tool traces、policy checks、security probes 與可重播 log。
3. 開源:Agent stack 分層成形
GitHub 上,Qwen-AgentWorld 是本週新專案代表;Codex、Claude Code、Gemini CLI、Goose 顯示 terminal agent 進入高頻 release;CUA、browser-use、Playwright MCP 補 computer-use / browser automation;OpenAI Agents SDK 則是 multi-agent workflow 與 runtime SDK 層。
這個 stack 化趨勢比單一 repo 的 star growth 更重要。builders 應該按層選型:coding workflow 用 terminal agent,web/desktop 用 computer-use layer,工具整合用 MCP / SDK,訓練與評測再看 world-model / environment repo。
本週總結
AI Agent 的下一階段不是更會聊天,而是更能被運營:可以收費、可以測試、可以審計、可以限制權限、可以在環境中訓練與重播。這會讓產品看起來更工程化,也會讓真正能落地的 agent 與 demo agent 拉開距離。
下週 Watchlist
- 豆包專業版是否公布更多付費、留存或企業導入數據。
- GitHub Copilot harness、Cursor benchmark 討論是否推動更嚴格 coding-agent 評測。
- Qwen-AgentWorld 是否有 paper / benchmark / downstream adoption。
- Codex、Claude Code、Gemini CLI 的 plugin 與 approval gate 是否成為團隊治理差異點。
- CUA、browser-use、Snyk 類工具是否把 sandbox、credential isolation、agent 防護做成預設工作流。


