AI 时代的新安全挑战
随着大语言模型与 AI 智能体的广泛应用,全新的安全威胁正在涌现:提示注入攻击可以操纵模型执行非预期行为, 越狱攻击能突破安全约束获取有害输出,Agent 自主决策可能导致未授权操作。 传统的网络安全防护体系已无法应对 AI 原生安全挑战。诺亚星辰率先提出 WinClaw 六维安全模型, 从资源内核到身份层面构建全栈 AI 安全防护,入选 IDC 中国 AI 安全报告,引领行业安全标准建设。
核心方案
面向 AI 大模型与智能体应用的全栈安全防护
WinClaw 智能体安全
面向 AI 智能体(Agent)应用的全栈安全防护方案,从六维模型出发,覆盖资源内核、访问界面、验证分组、意图分类、意图识别与身份层面,保障智能体业务安全可控。
典型场景
- 企业 AI 助手安全防护
- 客服智能体防注入与防越狱
- 代码生成 Agent 安全沙箱
核心能力
- 六维模型全面防护
- 提示注入攻击检测
- 越狱攻击防御
- Agent 行为审计
大模型防火墙
部署在大模型调用链路中的专用安全网关,对输入输出内容进行实时检测与过滤,防止敏感数据泄露、有害内容生成与模型滥用。
典型场景
- 大模型 API 调用安全审计
- 敏感数据防泄露与脱敏
- 内容合规与有害信息过滤
核心能力
- 输入输出双向检测
- 敏感数据脱敏
- 内容合规过滤
- 调用频率管控
Agent 运行时治理
针对 Agent 自主决策与工具调用行为提供运行时治理能力,包括权限管控、行为监控、异常熔断与回溯审计,确保 Agent 始终在可控范围内运行。
典型场景
- 多 Agent 协作系统行为治理
- Agent 工具调用权限管控
- 异常行为自动熔断与告警
核心能力
- 工具调用权限管控
- 行为实时监控
- 异常自动熔断
- 全链路回溯审计
智能体安全六维模型
智能体安全的六大维度防护框架,从底层资源到身份管理的纵深防御体系
身份
建立 Agent 与用户的统一身份体系,实施身份认证、角色授权与会话管理,确保所有操作可追溯、责任可界定。
身份冒用、越权操作、会话劫持
工具
管控 Agent 对外部工具与 API 的调用行为,实施工具调用权限审批与范围限制,防止未授权的工具执行。
API 滥用、未授权调用、恶意工具执行
意图
对用户输入与 Agent 行为进行实时意图识别,检测提示注入、越狱攻击等恶意指令与异常请求。
提示注入、越狱攻击、社会工程
记忆
保护 Agent 的记忆与上下文数据安全,防止记忆篡改、敏感信息泄露与跨会话数据窃取。
记忆篡改、数据泄露、跨会话攻击
行为
监控 Agent 的自主决策与执行行为,实施行为基线检测、异常熔断与全链路审计,确保行为可控。
行为失控、异常操作、审计缺失
运行环境
保障 Agent 运行时的底层环境安全,包括沙箱隔离、资源配额与运行时防护,防止环境逃逸与资源滥用。
沙箱逃逸、资源滥用、环境入侵
典型攻击与防护
应对 AI 时代的全新安全挑战
提示注入攻击
攻击者通过精心构造的输入指令,操纵大模型执行非预期行为,绕过安全约束获取未授权信息。
越狱攻击
通过角色扮演、多轮诱导等手法突破大模型安全边界,使模型输出有害、违规或敏感内容。
数据泄露
通过逆向提问、推理攻击等手法,从大模型响应中提取训练数据中的敏感信息或企业机密。
Agent 行为失控
Agent 在自主决策过程中产生偏离预期的行为,包括未授权的工具调用、数据访问或资金操作。