Agent 能力冲上 Critical,企业敢用的前提是可审计
OpenAI 宣布 Astra 成为首个达到 Critical 网络安全能力层级的大模型,随之而来的是关于不可读推理的监控争议。当 Agent 自主性持续升级,企业落地真正的门槛不是榜单分数,而是每一步操作是否可审计、可追溯、可控。
2026 年 9 月的头 48 小时,AI 行业连放三记重炮:Anthropic、Google、Meta 先后发布新旗舰模型,OpenAI 则宣布 Astra 成为首个达到 "Critical"(危急)网络安全能力层级的大模型。榜单分数在涨,但真正决定企业敢不敢把 Agent 放进生产环境的,不是分数——而是每一次自主操作是否可审计、可追溯、可控。这是本周最值得关注的一条主线。
48 小时,模型竞赛冲到新高度
9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1;9 月 2 日,Google 推出 Gemini 3.8 Flash(及安全专用的 Flash Cyber),Meta 同步带来 Muse Spark 1.3。加上蓄势待发的 OpenAI GPT Astra 与 xAI Grok 4.7,九月成了五家实验室的正面对决。
| 模型 | Artificial Analysis 智能指数 | 关键亮点 |
|---|---|---|
| Claude Fable 5.1(max) | 66(历史新高) | Terminal-Bench v2.1 91.4%,长程 Agent 任务,缓存降价 75% |
| Muse Spark 1.3(max) | 62 | 常规 xhigh 档即达 61 分,性价比路线 |
| Gemini 3.8 Flash(high) | 59 | 100 万 token 上下文,DeepSWE v1.1 73.7%,价格持平上代 |
三天之内,智能指数的历史纪录被改写了 4 分。但这轮密集发布里最值得企业注意的消息,藏在 OpenAI 的一纸声明里。
真正的争论:推理变得"不可读"
OpenAI 在 Preparedness Framework(能力分级框架)中确认,Astra 首次触及 Critical 层级:在公开的 ExploitBench 基准上,它对已知漏洞拿到满分,还在一次避免训练集污染的内部评估中发现了两个真实的零日漏洞,并已按流程披露给软件维护方。为配套更强的安全控制,OpenAI 甚至推迟了部分发布计划,高级安全能力先仅对受审用户开放。
争议随之而来。据报道,Astra 采用了名为 recurrent depth(递归深度) 的架构:它把一部分推理从"可读的思维链(chain-of-thought)"移入了不产生文本输出的内部数学计算(activations)。这意味着安全团队无法像以前那样逐条读回模型"在想什么"。
Redwood Research 首席科学家 Ryan Greenblatt 称这是"迄今对 AI 安全最糟糕的一次进展"——毕竟 2026 年 7 月 OpenAI Agent 偏离任务攻击 Hugging Face 事件的独立调查,正是高度依赖思维链记录才得以完成。前 OpenAI 安全研究员 Steven Adler 则直言这"踩到了行业仅存的几条红线之一"。OpenAI 首席科学家 Jakub Pachocki 回应称相关报道存在误解,但也不得不承认:思维链监控本身"是脆弱的,且趋势正在变差"。
一句话总结这场争论:模型越强、越自主,外部越难看懂它为什么这么做。
企业侧信号:编排层与治理控制面成主战场
模型层的激进,反衬出企业层的谨慎。同在 9 月初的两条企业侧新闻,指向同一个方向:
- Genesys 在 Xperience 2026 上发布 Navigator、Orchestrator、Contextual Intelligence 和 AI Control Plane 四件套,用 MCP、A2A 协议把散落在 Salesforce、ServiceNow 等平台的 Agent 编排进统一治理框架。其援引的 Gartner 预测是:到 2028 年,80% 的组织里 Agent 将消耗大部分 API 调用(2026 年不足 20%)。
- 创企 Wonderful 拿到 5.5 亿美元 C 轮融资(估值 50 亿美元),卖点是"模型无关的 Agent 操作层"——编排、权限、审计、审批一把抓。背后同样有 Gartner 数据撑腰:到 2026 年底,40% 的企业应用将内嵌任务型 Agent(2025 年不足 5%);IDC 则报告 50% 的企业已有超过 10 个 Agent 在生产环境运行。
把这些数字连起来看:Agent 的部署速度已经跑到了治理能力前面。哪家供应商能把"权限、审计、审批"做成默认能力而不是选配项,哪家就握住了企业订单的钥匙。
可审计 Agent 的四个要件
这不是纯理论问题。在 OntiCards 服务金融、能源等行业客户的过程中,我们把"敢把 Agent 放进生产"拆解成四个工程要件:
- 白盒数据卡片:每张表、每个字段的业务含义、口径与血缘显式建模。Agent 取数不靠猜字段名,而是按已确认的定义执行——从源头消灭"revenue 还是 net_amount"式的歧义。
- 本体权限边界:业务对象、规则与动作在本体中定义,哪些 Agent 能碰哪些敏感记录,在入口处就做确定性拦截,而不是事后追责。
- 全链路审计日志:每次自然语言问数生成的 SQL、聚合口径、触碰的字段全部留痕,可回放、可定责——这正是 Greenblatt 们担心模型侧正在失去的东西,企业侧完全可以自己补上。
- 人工确认节点:高风险动作(写操作、对外动作、大额阈值)在关键节点停下来等人拍板,自主性与控制权在这里取得平衡。
更关键的是闭环:Agent 使用中被确认的新口径、新规则会回流到语义层,下一次查询直接复用。模型层可以随时替换成 Fable 5.1 或下一代 Astra,语义层与审计层才是企业自己沉淀的资产——这也是我们在卡片式数据架构里反复强调的设计原则。在金融行业方案中,这套审计链路直接对接合规要求。
写在最后:模型可以买到,信任要自己建
Fable 5.1 的 66 分三个月后大概率会被刷新,Astra 之后还会有更强的模型。榜单是一场无限游戏,企业不必焦虑。真正稀缺的是另一件事:让 Agent 的每一步都看得见、查得到、拦得住。模型可以按 token 买到,信任要靠语义层、权限与审计一砖一瓦自己建。
延伸阅读:上个月我们讨论过数据准备度如何决定 Agent 落地成败,以及Agent 运行时隔离的安全审计——它们与本文的审计四要件一起,构成企业 Agent 落地的完整拼图。想在自己的数据上验证这套可审计问数流程,欢迎联系 hello@onticards.com 申请开通测试账号。