你的 AI 代理能完成工作,卻花了不少時間,直覺上的解法似乎是換成更大的模型。先讀一讀它的執行軌跡:多花的時間,究竟是在挽救過去會被代理放棄的任務,還是在重做已完成的工作?無論是哪一種,答案都可能指向比更換模型更精準、成本更低的調整。

代理執行軌跡會依步驟記錄一次執行中的每次模型呼叫與工具呼叫,並附上時間資訊及結果。搭配自動化完成檢查,就能看出代理如何得出答案,而不只是有沒有得出答案。NVIDIA NeMo Relay 會以事件日誌、可讀的執行歷程及 OpenTelemetry spans 記錄軌跡。

NeMo Relay 教學 訂出了變更的驗收門檻:變更必須能穩定重現完成率的提升,或在維持完成率的同時,改善你鎖定的可靠性、延遲或成本指標。FAIS 就是以這種方式維運既有代理:先用固定案例記錄現有助理的執行軌跡,再修正反覆出現的問題根源,而不是先編列更換模型的預算。

速度較慢的代理,可能把工作做得更好嗎?

速度較慢的代理,可能正在完成過去會放棄的工作。Nous Research 於 2026 年 8 月 6 日重新執行 Hermes ToolPerf 測試,比較鎖定版本的基準組與套用工具層修正的組別;Qwen3 Coder 30B 的結果就呈現了這種情況:

Qwen3 Coder 30B 指標基準組工具修正組
經驗證完成的執行次數19/2722/27
平均模型呼叫次數3.84.9
平均耗時27 秒42 秒

共 9 項任務,每個模型在每個組別各執行每項任務 3 次(共 108 次執行),使用完全相同的提示、限制與檢查。兩組之間只差一批工具層變更(鎖定的設定),因此結果反映的是整批變更,而不是各項修正的個別效果。

這些平均值只是其中一次測試的結果。在 8 月 2 日針對同一批變更、但採用不同基準的測試中,Qwen 套用修正後的回合數減少了 21%,完成率卻從 74% 降至 67%;維護團隊指出,這次重測並不是單純重現先前的結果。每項任務重複執行 3 次,逐項檢視執行軌跡,就能看出哪些額外步驟換來了任務完成,哪些只是白費力氣。

Claude Sonnet 4.5 在基準組完成了 27 次執行中的 24 次,套用修正後則完成了 27 次中的 23 次:沒有實質變化,而且它的起點就高於 Qwen 修正後達到的水準。較早的 8 月 2 日測試發現,較強的模型原本就能在 1 個回合內,從大多數刻意引入的錯誤中恢復。模型選擇仍然重要;執行軌跡能告訴你,問題是否出在模型。

「AI 代理速度慢,是效率差,還是在挽救任務?更換模型前,先看執行軌跡」的說明插圖

哪些額外步驟值得保留?

Hermes 任務層級稽核與任務評分表呈現了 4 種模式:

  • 保留能換來任務完成的補救步驟。 在指令遭阻擋的任務中,Qwen 的完成率從 33% 升至 100%,因為補救指引讓它在解析器阻擋指令後仍能繼續。正如 NVIDIA 與 Nous Research 的作者所說:「補救會耗用回合,直接放棄則完全不會。」
  • 減少重複讀取。 在大型檔案任務中,完成率從 67% 升至 100%,但 Qwen 重複讀取的次數超出所需:保留較大的單次讀取範圍,刪減重複讀取。
  • 檢視會讓代理偏離方向的工具訊息。 在不區分大小寫的搜尋任務中,Qwen 的平均回合數從 3.3 升至 9.3,完成率卻沒有變化;1 則探查未找到相符結果的訊息,在 3 次重複執行中的 2 次引發了額外搜尋。
  • 將工具與供應商端的故障,和模型行為分開判讀。 在隱藏檔案搜尋任務中,Sonnet 在兩組的完成率都是 0%,Qwen 則先後為 33% 與 0%,這是已知的工具功能缺口。供應商端的聊天範本故障,讓 Qwen 在基準組的 5 次執行及修正組的 2 次執行中途終止,拉低了兩組的完成率。

如何決定下一項調整?

NeMo Relay 評估方法提供了以下順序:

  1. 固定一組案例,並設定明確的自動化完成檢查。
  2. 重複執行基準測試,記錄執行軌跡。
  3. 只調整一項問題根源,例如提示、工具訊息或設定,同時維持模型、供應商、輸入與限制不變。
  4. 以相同次數重複執行;先比較經驗證的完成率,再比較呼叫次數、時間與成本。

用執行軌跡取代猜測,會帶來什麼改變?

以下是一個示意情境:台灣一家精密零件製造商,透過接單助理為採購單擬定回覆,並逐一核對每個明細項目與 ERP 中的零件主檔及目前圖面版次。

原本,業務協調人員每份草稿都得等,團隊則開始評估更大模型的費用。針對固定採購單記錄執行軌跡後,發現助理每遇到引用同一張圖面的明細項目,就會重新擷取一次圖面。修正範圍很小:保留該張訂單首次讀取的內容,並確認草稿仍引用正確版次。每封回覆依然由協調人員核准。衡量通過驗收的草稿數,以及每份通過驗收草稿所需的時間與成本,並將失敗嘗試一併計入。

有些執行軌跡揭露的問題不只在工具。當客戶料號、ERP 品項代碼與圖面版次看起來彼此無關,導致代理不斷搜尋時,缺少的是共用定義,而不是更大的模型。FAIS 的基礎企業本體(ontology)會對應客戶、零件、版次與訂單,以及 ERP 和 CRM 紀錄之間的關係,讓代理透過為各系統建置的連接器,依據同一套定義運作,而不必每次執行都重新推導。

從一個助理與一組固定案例開始

選定一個助理,與負責簽核其產出的人議定驗收檢查,將真實案例固定下來,並重複執行基準測試、記錄軌跡。請將執行軌跡視為敏感資料;依設定而定,其中可能包含提示、模型回應、工具引數、檔案路徑及應用程式資料。

如果你的代理速度慢,卻沒有人說得出原因,這就是與我們討論工作流程的好理由。

資料來源

  1. Tracing Agent Harness Behavior with NVIDIA NeMo Relay | NVIDIA Technical Blog
  2. Rerun 2026-08-06 — full reproducible battery, checked-in data
  3. Hermes ToolPerf August 6 rerun — scored task tables
  4. Tracking: core toolset performance batch — terminal & file-ops turn-efficiency (12 PRs) · Issue #77056 · NousResearch/hermes-agent · GitHub

營運團隊常見問題

AI 代理執行軌跡會依步驟記錄一次執行中的每次模型呼叫與工具呼叫,並附上時間資訊及結果。它能呈現代理如何得出答案,而不只是有沒有得出答案。

AI 代理速度較慢,代表模型比較差嗎?

不一定。在 Nous Research 的 2026 年 8 月 6 日 Hermes ToolPerf 重測中,Qwen3 Coder 30B 套用工具修正後,完成了 27 次執行中的 22 次,相較之下原本為 27 次中的 19 次,而平均耗時則從 27 秒增至 42 秒,主要是因為它挽救了過去會放棄的任務。

如何測試一項調整是否真的讓代理變快?

固定一組案例並設定自動化完成檢查,重複執行基準測試並記錄軌跡,在維持模型、供應商、輸入與限制不變的情況下,只調整一項問題根源,再以相同次數重複執行。先比較經驗證的完成率,再比較呼叫次數、時間與成本。