一套闭环,三个关键时刻
每一个Agent都在同一条生命周期上运行:上线前完成验收,运行中持续守护,发生变化时重新验证。
| 阶段 | Sentinel能力 | 核心问题 | 主要输出 |
|---|---|---|---|
| 上线前 | Sentinel Verify | 这个Agent整体上安全到可以上线吗? | 独立红队测试、安全评级、风险边界、整改建议 |
| 运行中 | Sentinel Live | 这一次具体行动安全吗? | 允许 / 拒绝 / 人工确认 / 风险告警与审计证据 |
| 发生变化 | Sentinel Guard | 模型或环境变化后,现在还安全吗? | 影响评估、自动复测、安全证据与等级更新 |
01. 上线前
Sentinel Verify:第三方独立安全验收
Verify的核心角色类似企业采购关键软件、芯片或安全设备时的第三方验收:站在业务企业一侧、独立于Agent供应商,回答"这个系统是否达到可以被赋予真实权限的安全水平"。
明确评测边界
固定模型版本、系统提示词、工具接口、权限与关键业务流程。
定义威胁模型
攻击者能力、可访问信息、预算与可复用性,精确定义。
对抗测试
自动化与人工结合:注入、劫持、误用、数据泄露。
量化证据报告
攻破系统所需的成本、能力与证据,量化呈现。
02. 运行中
Sentinel Live:上线后的实时安全裁决
Verify的安全结论本质上仍然是针对既定威胁模型和测试分布的统计性证据,不可能保证未来每一次行为都绝对安全。当Agent正式进入生产环境后,Sentinel Live将持续观察高风险动作并在执行前做安全裁决。
输入侧
检测恶意输入、间接Prompt Injection、内容篡改和异常上下文。
决策侧
判断当前行为是否符合任务目标、历史轨迹和已验收的安全边界。
权限侧
判断工具调用、数据访问和外部动作是否越权或超出业务规则。
执行侧
低风险允许执行;高风险拦截、降权或要求人工确认,并向负责人汇报。
03. 发生变化
Sentinel Guard:为什么安全必须持续更新
Agent是高度动态的软件系统。模型升级、Prompt修改、RAG数据变化、MCP/工具新增、权限调整甚至攻击模型能力提升,都可能改变原有安全结论。Sentinel将安全证据与具体配置绑定。
变化检测
持续追踪模型、Prompt、RAG、工具、权限与攻击能力的变化。
影响评估
在问题进入生产环境之前,评估每一次变化对既有评级边界的影响。
自动复测
自动生成测试用例执行复测;Live的真实拦截数据反哺下一轮Verify。