← 返回博客行業

Agent 能力衝上 Critical,企業敢用嘅前提係可審計

OpenAI 宣布 Astra 成為首個達到 Critical 網絡安全能力層級嘅大模型,隨之而嚟嘅係「不可讀推理」嘅監控爭議。當 Agent 自主性持續升級,企業落地真正嘅門檻唔係榜單分數,而係每一步操作係咪可審計、可追溯、可控。

OntiCards 團隊·2026-09-04·6 分鐘閱讀
Agent 能力衝上 Critical,企業敢用嘅前提係可審計

2026 年 9 月開頭 48 個鐘,AI 行業連放三記重炮:Anthropic、Google、Meta 先後發布新旗艦模型,OpenAI 就宣布 Astra 成為首個達到「Critical」(危急)網絡安全能力層級嘅大模型。榜單分數不斷攀升,但真正決定企業敢唔敢將 Agent 放入生產環境嘅,唔係分數——而係每一次自主操作係咪可審計、可追溯、可控。呢個係今個星期最值得留意嘅一條主線。

48 個鐘,模型競賽衝上新高

9 月 1 號,Anthropic 發布 Claude Fable 5.1 同 Mythos 5.1;9 月 2 號,Google 推出 Gemini 3.8 Flash(同埋安全專用嘅 Flash Cyber),Meta 同步帶嚟 Muse Spark 1.3。加上蓄勢待發嘅 OpenAI GPT Astra 同 xAI Grok 4.7,九月成為五間實驗室嘅正面對決。

模型Artificial Analysis 智能指數關鍵亮點
Claude Fable 5.1(max)66(歷史新高)Terminal-Bench v2.1 91.4%,長程 Agent 任務,快取減價 75%
Muse Spark 1.3(max)62常規 xhigh 檔已達 61 分,性價比路線
Gemini 3.8 Flash(high)59100 萬 token 上下文,DeepSWE v1.1 73.7%,定價同上代持平

三日之內,智能指數嘅歷史紀錄被改寫咗 4 分。但呢輪密集發布入面最值得企業注意嘅消息,收埋喺 OpenAI 一紙聲明入面。

真正嘅爭論:推理變得「不可讀」

OpenAI 喺 Preparedness Framework(能力分級框架)入面確認,Astra 首次觸及 Critical 層級:喺公開嘅 ExploitBench 基準上,佢對已知漏洞攞到滿分,仲喺一次避免訓練集污染嘅內部評估中搵到兩個真實嘅零日漏洞,並且已經按流程披露畀軟件維護方。為咗配套更強嘅安全控制,OpenAI 甚至延遲咗部分發布計劃,高級安全能力暫時只對受審用戶開放。

爭議隨之而嚟。據報道,Astra 採用咗名為 recurrent depth(遞歸深度) 嘅架構:佢將一部分推理由「可讀嘅思維鏈(chain-of-thought)」移入咗唔會產生文本輸出嘅內部數學計算(activations)。即係話,安全團隊冇得好似以前咁樣逐條讀返模型「諗緊乜」。

兩種推理路徑嘅可監控性對比:思維鏈可以逐條讀返轉頭,遞歸深度就移入不可讀嘅內部激活
兩種推理路徑嘅可監控性對比:思維鏈可以逐條讀返轉頭,遞歸深度就移入不可讀嘅內部激活

Redwood Research 首席科學家 Ryan Greenblatt 話呢個係「迄今對 AI 安全最惡劣嘅一次進展」——始終 2026 年 7 月 OpenAI Agent 偏離任務攻擊 Hugging Face 事件嘅獨立調查,正正係高度依賴思維鏈紀錄先至完成到。前 OpenAI 安全研究員 Steven Adler 就直指呢個「踩咗行業僅存嘅幾條紅線之一」。OpenAI 首席科學家 Jakub Pachocki 回應話相關報道有誤解,但都唔唔好唔承認:思維鏈監控本身「係脆弱嘅,而且趨勢正在轉差」。

一句講晒:模型越強、越自主,外部越難睇得明佢點解咁做。

企業側訊號:編排層同治理控制面成為主戰場

模型層嘅激進,反襯出企業層嘅審慎。同樣喺 9 月初嘅兩單企業側新聞,指向同一個方向:

  • Genesys 喺 Xperience 2026 上發布 Navigator、Orchestrator、Contextual Intelligence 同 AI Control Plane 四件套,用 MCP、A2A 協議將散落喺 Salesforce、ServiceNow 等平台嘅 Agent 編排入統一治理框架。佢引述嘅 Gartner 預測係:到 2028 年,80% 嘅組織入面 Agent 將會消耗大部分 API 調用(2026 年唔夠 20%)。
  • 初創 Wonderful 攞到 5.5 億美元 C 輪融資(估值 50 億美元),賣點係「模型無關嘅 Agent 操作層」——編排、權限、審計、審批一腳踢。背後同樣有 Gartner 數據撐腰:到 2026 年底,40% 嘅企業應用將會內嵌任務型 Agent(2025 年唔夠 5%);IDC 就報告 50% 嘅企業已有超過 10 個 Agent 喺生產環境運行。

將呢啲數字串埋一齊睇:Agent 嘅部署速度已經跑贏咗治理能力。邊間供應商可以將「權限、審計、審批」做成預設能力而唔係選配項,邊間就握住咗企業訂單嘅鎖匙。

可審計 Agent 嘅四個要件

呢個唔係純理論問題。喺 OntiCards 服務金融、能源等行業客戶嘅過程入面,我哋將「敢將 Agent 放入生產」拆解成四個工程要件:

可審計 Agent 嘅四個要件:白盒數據卡片、本體權限邊界、全鏈路審計日誌、人工確認節點,形成持續回流閉環
可審計 Agent 嘅四個要件:白盒數據卡片、本體權限邊界、全鏈路審計日誌、人工確認節點,形成持續回流閉環

  1. 白盒數據卡片:每張表、每個欄位嘅業務含義、口徑同血緣顯式建模。Agent 攞數唔靠估欄位名,而係按已確認嘅定義執行——由源頭消滅「revenue 定 net_amount」式嘅歧義。
  1. 本體權限邊界:業務對象、規則同動作喺本體中定義,邊個 Agent 掂到邊啲敏感紀錄,喺入口位就 deterministically 攔截,而唔係事後追究。
  1. 全鏈路審計日誌:每次自然語言問數生成嘅 SQL、聚合口徑、掂過嘅欄位全部留痕,可以回放、可以定責——呢樣正正係 Greenblatt 們擔心模型側逐漸失去嘅嘢,企業側完全可以自己補返。
  1. 人工確認節點:高風險動作(寫入操作、對外動作、大額門檻)喺關鍵節點停低等人拍板,自主性同控制權喺呢度取得平衡。

更加關鍵嘅係閉環:Agent 使用過程入面被確認嘅新口徑、新規則會回流去語義層,下一次查詢直接重用。模型層可以隨時轉用 Fable 5.1 或者下一代 Astra,語義層同審計層先至係企業自己沉澱嘅資產——呢個亦係我哋喺卡片式數據架構入面一路強調嘅設計原則。喺金融行業方案入面,呢套審計鏈路直接對接合規要求。

寫喺最後:模型可以買到,信任要自己起

Fable 5.1 嘅 66 分三個月之後大概率會被刷新,Astra 之後仲會有更強嘅模型。榜單係一場無限遊戲,企業唔使焦慮。真正稀缺嘅係另一樣嘢:令 Agent 嘅每一步都睇得到、查得到、攔得住。模型可以按 token 買到,信任要靠語義層、權限同審計一磚一瓦自己起。

延伸閱讀:上個月我哋討論過數據準備度點樣決定 Agent 落地成敗,同埋Agent 運行時隔離嘅安全審計——佢哋同本文嘅審計四要件一齊,砌出企業 Agent 落地嘅完整拼圖。想喺自己嘅數據上驗證呢套可審計問數流程,歡迎聯絡 hello@onticards.com 申請開通測試帳號。

參考來源

行業

對 OntiCards 感興趣?