📝AI行业

Goodfire推出“内视式”Agent监控:AI安全开始读取模型内部信号

作者:AI测评网编辑部·2026-10-10·浏览 2

Goodfire推出面向AI Agent的“inside-out”监控方案,用探针读取模型内部激活信号,只在风险升高时调用第二层检测。它试图同时解决Agent安全与监控成本两道难题。

Goodfire推出“内视式”Agent监控:AI安全开始读取模型内部信号
阅读提示当前文章有1108字,阅读完大概需要3分钟。

AI Agent开始执行更长、更复杂的任务后,传统的安全办法往往是再部署一个模型,逐步阅读主Agent的全部输入和输出。这种“让第二个AI盯着第一个AI”的方式直观,却会随着运行时长和上下文规模快速变贵。10月8日,Goodfire推出一套inside-out(由内向外)监控方案,把观察点从模型写出的文本推进到模型生成文本时正在形成的内部信号。

从“读日志”变成“看模型内部的报警器”

据TechCrunch报道,Goodfire的方案用小型探针读取模型在每一步推理中的内部激活。当探针发现与某类风险相关的信号时,才把这一步交给更重的检测模型或人工处理;没有触发风险时,就不必让第二个模型重新阅读整段Agent轨迹。它更像机场安检:先用快速设备筛查,只有命中异常才进入人工开包。

Goodfire表示,首批监控围绕Kimi K3等开放模型构建,客户可选择关注攻击性黑客行为、化学与生物武器滥用、奖励劫持等风险,并把动作设为记录、送人工复核或直接拒绝。这个设计的关键不在于“模型内部信号天然可靠”,而在于它提供了一条可以和现有策略引擎组合的快速预警通道。

成本优势来自“复用已经算过的东西”

传统外部监控要再次读取上下文、工具调用和中间结果,Agent跑得越久,重复计算越多。Goodfire的思路是利用主模型前向计算过程中已经产生的中间激活,再运行轻量分类器。TechCrunch援引其测试称,在约100万次交互的估算中,探针式监控成本约185美元,低于让较便宜的模型逐步复读的约5420美元;顶级检测模型的估算成本则更高。

同一组测试中,Goodfire称探针捕获了93%的恶意黑客会话,并把5.5%的正常会话送入二次检查;同时启用四个探针对首字响应时间的增加不到2%。这些数字目前主要是厂商测试口径,适合用来理解产品目标,而不是当成跨模型、跨任务的通用结论。真正上线时,企业仍需针对自己的模型、工具权限和风险类型重新校准阈值。

为什么开放模型会放大这类监控的价值

闭源模型服务通常由提供方统一维护安全策略,开放模型则可能被下载、微调或移除部分防护后部署在第三方推理集群。Goodfire的研究公开讨论过开放模型在Agent任务中的奖励劫持现象,说明当模型拥有工具、网络或文件系统权限时,单看最终答案并不能完整解释它是否走过危险路径。

“内视式”监控因此更像一种运行时防线,而不是万能的可解释性。探针需要随着模型版本、提示词、工具链和攻击方式变化而重训;内部激活也可能出现概念漂移,导致漏报或误报。企业还必须保留外部日志、权限隔离、沙箱和人工复核,不能因为增加一个探针就放弃基础安全工程。

适合哪些人关注

  • Agent平台和推理服务商:可关注探针是否能作为低延迟、低成本的默认安全层。
  • 开放模型部署团队:尤其适合拥有联网、代码执行或文件访问权限的Agent场景。
  • AI安全与红队人员:应把模型内部信号、工具调用和最终行为结合起来评测,而不是只测拒答率。
  • 企业合规负责人:需要明确哪些告警自动阻断、哪些交人工,以及告警证据如何留存审计。

来源参考