AI 时代的新安全挑战
随着大语言模型与 AI 智能体的广泛应用,全新的安全威胁正在涌现:提示注入攻击可以操纵模型执行非预期行为, 越狱攻击能突破安全约束获取有害输出,Agent 自主决策可能导致未授权操作。 传统的网络安全防护体系已无法应对 AI 原生安全挑战。诺亚星辰率先提出 WinClaw 六维安全模型, 从资源内核到身份层面构建全栈 AI 安全防护,入选 IDC 中国 AI 安全报告,引领行业安全标准建设。
核心方案
面向 AI 大模型与智能体应用的全栈安全防护
WinClaw 智能体安全
面向 AI 智能体(Agent)应用的全栈安全防护方案,从六维模型出发,覆盖资源内核、访问界面、验证分组、意图分类、意图识别与身份层面,保障智能体业务安全可控。
典型场景
- 企业 AI 助手与数字员工安全防护
- 客服智能体防注入与防越狱
- 代码生成 Agent 安全沙箱
核心能力
- 六维模型全面防护
- 提示注入攻击检测
- 越狱攻击防御
- Agent 行为审计
大模型防火墙
部署在大模型调用链路中的专用安全网关,对输入输出内容进行实时检测与过滤,防止敏感数据泄露、有害内容生成与模型滥用。
典型场景
- 大模型 API 调用安全审计
- 敏感数据防泄露与脱敏
- 内容合规与有害信息过滤
核心能力
- 输入输出双向检测
- 敏感数据脱敏
- 内容合规过滤
- 调用频率管控
Agent 运行时治理
针对 Agent 自主决策与工具调用行为提供运行时治理能力,包括权限管控、行为监控、异常熔断与回溯审计,确保 Agent 始终在可控范围内运行。
典型场景
- 多 Agent 协作系统行为治理
- Agent 工具调用权限管控
- 异常行为自动熔断与告警
核心能力
- 工具调用权限管控
- 行为实时监控
- 异常自动熔断
- 全链路回溯审计
WinClaw 六维模型
智能体安全的六大维度防护框架,从底层资源到身份管理的纵深防御体系
资源内核
保护模型权重、训练数据与底层算力资源,防止模型窃取与算力滥用。
确保大模型核心资产(模型参数、训练语料、推理算力)不被未授权访问或窃取,监控算力使用情况防止资源滥用与挖矿行为。
模型窃取、算力滥用、数据投毒
访问界面
管控对外暴露的 API、对话界面等访问通道,防止未授权访问与接口滥用。
对大模型对外暴露的所有访问通道(API 接口、对话窗口、插件系统)进行统一管控,实施速率限制、异常检测与访问审计。
API 滥用、未授权访问、DDoS 攻击
验证分组
对调用方进行身份验证与分组授权,实现细粒度的访问控制。
建立多因子身份验证机制,按角色、部门、项目进行分组授权,实现最小权限原则下的精细访问控制与操作审计。
身份冒用、越权操作、横向渗透
意图分类
对用户输入与 Agent 行为进行意图分类,识别恶意指令与异常请求。
基于语义理解对输入进行意图分类(正常咨询/知识获取/攻击尝试/越狱尝试),结合规则引擎与语义模型双重检测,覆盖已知与未知攻击模式。
提示注入、社会工程、绕过检测
意图识别
基于语义与行为特征实时识别攻击意图,包括提示注入、越狱攻击等。
通过实时语义分析与行为模式匹配,精准识别各类攻击意图,包括直接注入、间接注入、多轮对话攻击与角色扮演越狱等高级攻击手法。
越狱攻击、多轮注入、角色扮演攻击
身份层面
建立 Agent 与用户的身份体系,确保行为可追溯、责任可界定。
为每个 Agent 实例与用户会话建立唯一身份标识,记录全链路操作日志,实现行为可追溯、责任可界定、异常可溯源。
行为不可追溯、责任难以界定、审计缺失
典型攻击与防护
应对 AI 时代的全新安全挑战
提示注入攻击
攻击者通过精心构造的输入指令,操纵大模型执行非预期行为,绕过安全约束获取未授权信息。
越狱攻击
通过角色扮演、多轮诱导等手法突破大模型安全边界,使模型输出有害、违规或敏感内容。
数据泄露
通过逆向提问、推理攻击等手法,从大模型响应中提取训练数据中的敏感信息或企业机密。
Agent 行为失控
Agent 在自主决策过程中产生偏离预期的行为,包括未授权的工具调用、数据访问或资金操作。