AI Agent 週報總覽:2026-05-04 至 2026-05-10 產業、研究與開源三條線

AI Agent 週報總覽:2026-05-04 至 2026-05-10 產業、研究與開源三條線

中文 EN

本文總覽 2026-05-04 到 2026-05-10 這一週的 AI Agent 進展。這週我把週報拆成三條線:產業新聞、前沿研究、GitHub 開源。原因很簡單:只看新聞會漏掉研究裡真正改變 agent 設計的東西;只看論文會看不到產品和企業部署壓力;只看 GitHub 又容易被 star 熱度帶偏。

三篇深度文在這裡:

一句話總結

這週的共同主題是:Agent 正在從「模型的一個功能」變成一套需要部署、評測、編排、工具接口和工程入口的作業層。

新聞線裡,OpenAI 把即時語音推向可執行介面,Anthropic 把金融 Agent 做成模板和交付公司,Microsoft 把 Agent 管理說成 operating model,NIST/CAISI 把前沿模型評估推到部署前。中國訊號則集中在降本、場景與付費。

研究線裡,重點不是更漂亮的 demo,而是更細的錯誤切面。Orchestration trace、TRAJECT-Bench、Tool Illusion、AggAgent 這幾條線都在說同一件事:Agent 不能只看 final answer,要看中間路徑、工具選擇、參數、順序、聚合和停止。

GitHub 線裡,開源注意力正在從抽象 agent framework 轉向 workflow entry point。Codex、Claude Code、opencode、Ruflo、TradingAgents、MCP/memory 類工具都指向一個方向:開發者想要 agent 進 terminal、codebase、金融研究、MCP workflow,而不是只停在聊天框。

這三條線合起來代表什麼

第一,Agent 的競爭重心正在離開單一模型。模型還是地基,但真正能不能用,取決於工具、資料、權限、審計、成本、介面和交付團隊。

第二,Agent 評測會變得更像系統測試。以後只說「答對率」不夠,要能回放 trajectory,看到它選了什麼工具、哪個參數錯了、哪一步不該繼續、哪個 sub-agent 的輸出污染了結果。

第三,開源會先在開發者工作流裡變現。Coding agent 是最自然的場景,因為 terminal、git、repo、PR、issue 本來就是可觀察、可回放、可測試的環境。這也解釋了為什麼 Codex、Claude Code、opencode 會一起高增長。

第四,金融會繼續是 Agent 的重要垂直戰場。Anthropic 的金融模板和 TradingAgents 的開源熱度不是同一件事,但它們都指向一個事實:金融工作天然有資料、流程、審核、artifact、風控和高價值任務,很適合測 Agent 是否真的能交付。

Builder watchlist

如果你這週只帶走幾個問題,我會選這些:

  • 你的 agent 有沒有留下可回放的 trajectory?
  • 你的 eval 是看 final answer,還是看 tool selection、argument correctness 和 order?
  • 你的工具越接越多時,錯誤面有沒有被測到?
  • 你的 agent 是在聊天框裡表演,還是已經進到 terminal、Office、CRM、data connector、codebase 這些真正工作入口?
  • 你的成本控制是在模型層,還是在 workflow 層?

下週我會繼續看三件事:OpenAI Deployment Company 和 Anthropic enterprise services 的企業交付競爭;Baidu Create 2026 對文心 5.1 的實際 demo;以及 coding agent 開源專案的 release / plugin / sandbox / memory 進展。

References