文章

當系統看不見自己正在缺氧:從 AI Agent、自動化到制度設計

Agent 不該取代自動化,但把 Agent 放在自動化上方也還不夠。真正成熟的系統,必須能發現自己的感測盲點,並把安全外化成獨立監督、權限分離與制度。

當系統看不見自己正在缺氧:從 AI Agent、自動化到制度設計

自由潛水有一種特別值得系統設計者注意的危險:人可能在沒有足夠主觀警訊時,先因缺氧失去意識。

呼吸的迫切感很大一部分來自二氧化碳累積。潛水前過度換氣會降低二氧化碳,延後「必須呼吸」的感覺,卻沒有等比例增加身體可用的氧。於是,警報可能變安靜了,真正的危險卻仍在逼近。醫學文獻把這類水下缺氧失去意識稱為 hypoxic blackout;它也提醒我們,感覺不到危險,不等於危險不存在。NCBI Bookshelf 對其生理機制有簡要整理

人類對這個問題的回應很有意思。我們不是要求潛水者在失去意識後「更理性一點」,也不是期待體內原有的呼吸反射突然學會辨識所有例外。我們理解了自身警報系統的盲點,然後在身體之外建立機制:不獨自進行、由潛伴在不同狀態下觀察、事先約定監視與救援程序,並把事故經驗寫進訓練和規範。

這件事改變了我對 AI Agent 與自動化的理解。

Agent 不該取代 automation

我原本的想法是:Agent 取代的不是 automation,而是原本站在 automation 上方操作、判斷與介入的人。

Automation 適合處理已知、重複、可明確定義的工作。它快速、便宜、穩定、可測試,也比較容易稽核。Agent 則適合處理規則沒有涵蓋的情境:理解目標、處理歧義、協調衝突、規劃較長的行動,或者在流程失敗後找出新的恢復方式。

合理的執行路徑不是所有事件都先送進 LLM:

1
2
3
4
5
正常情況
Event → Automation → Action

未知或例外
Event → Automation → Escalation → Agent

這個區分很重要。如果 LLM 暫時無法使用,整條 production workflow 就完全停止,那不是自主系統,而是把單點故障換成了一個比較會說話的單點故障。

因此,Agent 比較像 supervisory controller。它不必重新實作底層流程,而是決定 automation 在什麼情境、以什麼目標、門檻、參數、優先順序與資源預算運作。當某種例外反覆出現,Agent 還應該把已驗證的處理方式沉澱成新的 automation,讓下一次不必重新推理。

人體不是「大腦指揮一切」

神經系統讓這個模型更往前一步。

脊髓與腦幹負責快速、持續且攸關生存的控制;小腦根據誤差修正動作並形成熟練技能;大腦皮質擅長處理新穎、抽象與較長時間尺度的問題。再把視丘、基底核、下視丘、海馬迴、杏仁核、自律神經和內分泌系統納入,就會發現人體並沒有一個單純的中央 Agent。

它更像許多專門閉環的協作:有的負責路由資訊,有的保留情境記憶,有的選擇或抑制行動,有的快速評估威脅,有的維持內部穩態,有的在局部直接完成感測、控制與回饋。

把它映射到軟體,大致會得到:

1
2
3
4
5
6
7
8
9
Memory ↔ Router ↔ Agent ↔ Action Gate
              ↕          ↕
          Risk Layer   Learner
              ↕          ↕
          Local Automation
                 ↕
             Environment

Homeostasis 與全域狀態持續調節各層

在這個模型中,Agent 不再是所有資訊與動作的必經之路。它只是特別擅長處理「系統還沒有學會的部分」。已知問題交給 automation;局部誤差由局部控制器修正;只有預測誤差過高、目標互相衝突或情境足夠陌生時,才向上升級。

這也改變了判斷 Agent 是否成功的標準。好的 Agent 不只是完成今天的任務,而是讓明天的同類任務逐漸不再需要它。

但多重閉環仍然可能一起看錯

到這裡,模型看起來已經很完整:感測、記憶、路由、風險、學習、穩態與高階推理各有分工。但自由潛水的例子指出了一個更深的問題。

控制器接觸不到「真實狀態本身」,只能接觸感測值以及代理指標:

1
2
3
4
5
6
7
真實狀態
   ↓  不一定能直接觀測
感測器/代理指標
   ↓
控制器的判斷
   ↓
行動

只要代理指標在某些條件下失去代表性,整個閉環就可能做出內部一致、外部錯誤的判斷。

軟體裡到處都有這種情況:API 回傳成功,但資料已損壞;測試全部通過,但測試沒有涵蓋真正的風險;儀表板仍是綠色,但監控資料早已停止更新;模型信心很高,但輸入已經超出適用範圍。更麻煩的是,若多個控制器共用同一批資料、模型與假設,它們不會互相補救,而可能一起犯錯。

所以,「多放一個 Agent 監督」並不自動等於安全。若兩個 Agent 使用相同模型、讀取相同資料、依賴相同服務、共享相同權限,它們就像兩位同時下潛的潛水者:人數增加了,獨立的救援能力卻沒有增加。

理性的價值,是能把保護機制移到自己之外

自由潛水真正提供的,不只是神經系統的類比,而是神經系統類比的邊界。

人類可以理解自己的感測器可能失真,推演「如果我失去意識,就不可能再靠自己修正」,然後改變活動的組織方式。這不是在既有控制器裡調整參數,而是在重新設計誰觀察誰、誰可以執行什麼,以及原控制器失效後由誰接管。

可以把學習分成三個層次:

1
2
3
4
5
6
7
8
參數適應
在既有控制架構裡調整門檻、權重與策略

架構適應
發現原有架構存在盲點,增加感測器或改變控制關係

制度適應
把新理解外化成角色、權限、程序、審核與共同記憶

最後一層尤其重要。個人的理解會消失,制度則能讓尚未親自遇過事故的人,仍然遵守從事故學到的規則。人類的能力因此不只存在於大腦裡,也存在於儀器、語言、同伴、操作程序、科學文獻和組織制度中。

軟體系統也需要「潛伴」

軟體裡的潛伴,應該具有與主要系統不同的失效條件。它不一定要比主要 Agent 更聰明,但必須保有足夠的獨立性:

  • 使用不同來源的觀測資料,而不是只重讀同一份輸出。
  • 在不同執行環境中運作,避免和主要系統同時失能。
  • 擁有最小但足夠的中止或隔離權限。
  • 不能被主要 Agent 任意停用或改寫。
  • 對高風險行動實施提案、核准與執行的角色分離。
  • 保留不可由執行者覆寫的稽核紀錄。
  • 透過 canary、故障注入與定期演練驗證保護機制真的有效。
  • 不只監控業務指標,也監控「監控是否仍在工作」。

這些做法的共同目的,是降低 common-mode failure:不要讓所有保護層因為同一原因一起失效。

這也解釋了為什麼治理不能只是最後附加的一個 approval button。治理應該橫跨系統的設計、測試、部署、監控與退場;獨立檢視則用來減少開發者盲點和利益衝突。這和 NIST AI Risk Management Framework 所強調的持續治理、角色責任、測試驗證及獨立審查方向相近。

Agent 的最高階工作,是參與機制設計

如果 Agent 只能處理流程內的例外,它仍然只是比較靈活的操作員。更高階的 Agent 應該能提出另一類問題:

  • 我們依賴的指標,在什麼情況下會失真?
  • 哪些重要狀態根本沒有被觀測?
  • 如果 Agent 自己失效,誰能發現?
  • 哪些保護機制其實共享同一個故障來源?
  • 哪些操作不應由同一主體提出、核准並執行?
  • 哪些事故知識還沒有變成可持續執行的規則?

Agent 可以根據事故、near miss 與反事實模擬,提出新的感測器、權限分離、交叉驗證、操作程序或安全邊界。可是,它不應單方面修改約束自己的最高規則。

比較安全的路徑是:

1
2
3
4
5
6
7
8
9
10
11
12
13
Agent 發現風險
      ↓
建立因果與失效模型
      ↓
提出新的外部機制
      ↓
模擬、測試與故障注入
      ↓
獨立審核/人類治理
      ↓
分階段部署
      ↓
成為新的制度與安全邊界

Agent 可以是制度演化的參與者,卻不能同時成為提案者、核准者、執行者和最終監督者。

從一個 Agent,走向能看見自身邊界的系統

完整的智慧自動化系統,至少包含五個層次:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
制度與外部治理
角色分離、獨立監督、標準與共同記憶
              ↕
Meta-control/Mechanism Design
發現盲點、建立失效模型、重新設計架構
              ↕
Agent/高階認知
未知問題、因果理解、推理與長期規劃
              ↕
專門控制與適應單元
記憶、路由、風險、仲裁、學習與穩態
              ↕
Automation/Local Control
快速、可靠、可測試的已知流程
              ↕
Environment

Automation 處理已知;局部控制器處理即時回饋;學習器把經驗轉成技能;Agent 處理尚未被系統吸收的未知;meta-control 研究整個控制架構可能如何失效;制度與外部治理則在主要系統失能時提供獨立保護,並保存跨越單一 Agent 壽命的知識。

因此,真正值得模仿的並不只是人腦,也不只是人體的神經系統,而是人類如何用理性理解自身限制,再透過工具、合作、科學與制度補上那些限制。

一個成熟的 Agent 系統,不只是能對環境採取行動,也不只是能調整自己的 automation。它還要知道:自己看到的不是世界本身,自己的警報可能沉默,自己的判斷可能失效;並且在仍有能力思考時,先把必要的保護放到自己之外。

本文章以 CC BY 4.0 授權