根据提供的网页截图,以下是关于“认知防火墙”(Cognitive Firewall)的关键信息总结: 漏洞概述 背景:大型语言模型(LLM)可能通过多轮对话被诱导生成有害内容,这种多轮攻击比单轮攻击更隐蔽且难以防御。 问题:现有的运行时安全防护措施通常将提示或响应作为独立单元处理,忽略了上下文、角色、权限和意图等关键因素,导致对复杂攻击的防御能力不足。 解决方案:提出了一种名为“认知防火墙”的主动式运行时监督框架,通过四个分类门控(意图门控、上下文门控、一致性门控、输出风险门控)来增强对多轮攻击的防御能力。 影响范围 适用对象:所有使用大型语言模型(LLM)的应用,尤其是那些涉及多轮对话的场景。 潜在风险: - 多轮攻击:攻击者可以通过逐步升级的对话策略,绕过现有的安全防护措施,诱导模型生成有害内容。 - 角色混淆:攻击者可以伪装成合法用户或系统角色,利用模型的信任机制进行恶意操作。 - 意图欺骗:攻击者可以通过模糊或误导性的指令,使模型执行非预期的操作。 修复方案 认知防火墙框架: - 意图门控(G1):在预生成阶段检查用户请求的意图,确保其合法性和安全性。 - 上下文门控(G2):在预生成阶段验证用户的角色、权限和上下文,防止角色混淆和权限滥用。 - 一致性门控(G3):在预生成阶段检查对话的一致性和升级情况,防止逐步升级的攻击。 - 输出风险门控(G4):在后生成阶段评估模型输出的风险,阻止有害内容的生成。 升级决策规则: - 通过组合多个门控的裁决结果,决定最终是否允许生成内容。 - 任何门控返回“不安全”或“有害”的裁决,都会阻止内容的生成。 POC代码或利用代码 无具体POC代码:页面中未提供具体的漏洞利用代码或概念验证(POC)代码。 总结 认知防火墙通过引入四个分类门控,增强了对多轮攻击的防御能力,能够有效识别和阻止潜在的安全威胁。该框架适用于所有使用LLM的应用,特别是在多轮对话场景中,能够显著提升系统的安全性。