DiSCO:分布引导对比提示优化为千万级文生图生态提供黑盒可用的提示端前置防御
文生图安全的核心矛盾正在从生成物审核转向提示端对抗;DiSCO 通过分布引导的对比提示优化,在不重训练模型、不访问权重的前提下对输入提示进行动态净化,为黑盒和开源并存的行业生态提供可迁移的前置防御范式。
核心机制:DiSCO 在做什么
DiSCO(Distribution-Guided Contrastive Prompt Optimization)是面向文本到图像生成模型的防御框架,针对的核心攻击是:攻击者构造对抗性或越狱式提示,使模型绕过安全限制生成有害内容。与常见的“生成后打码”不同,DiSCO 的关卡放在提示进入模型之前。
危险提示
▶
生成模型
▶
有害图像
✗
后置打码 / CLIP 过滤
(对抗提示可绕过)
危险提示
▶
▓▓ DiSCO 净化门 ▓▓
▶
安全等价提示
▶
生成模型
▶
安全图像
✔
分布引导:盯住输出分布偏移
对比优化:语义保持 → 映射安全空间
方法构成
分布引导 + 对比优化 + 提示改写
利用目标模型在对抗扰动下输出分布的偏移作为引导信号,通过对比损失在保持原始语义的前提下,将危险提示映射到安全提示空间。
该方法无需访问模型内部权重,属于黑盒可部署的一类。在当前“开源权重模型 + 闭源 API”混合生态中,这种解耦式防御更易作为独立安全层落地。
行业背景:提示端攻击成为文生图主要风险敞口
模型暴露规模
Stable Diffusion 开源后下载量迅速突破千万级
开源权重与商业 API 双轨并行,使对抗性提示攻击的受攻击面远大于传统过滤方案能覆盖的范围。
行业防御现状参差不齐:Stability AI 采用 Safety Checker 做生成后 CLIP 过滤,OpenAI DALL·E 系列依赖系统级内容审核,Midjourney 主要靠关键词黑名单。这些方案多为静态堵漏,缺少与模型行为分布绑定的动态响应。
-
后置过滤型:生成后由 CLIP 审核拦截,部署简单,但被对抗提示系统绕过已被公开研究验证
-
训练端对齐型:通过安全微调或词嵌入修正降低模型毒性,根治性强,但成本高且难以迁移到黑盒场景
-
提示端主动防御型:DiSCO 属于这一路线,在输入侧净化提示,同时保护开源与闭源模型,兼顾生成质量与安全性
DiSCO 的行业坐标与差异化
-
Safety Checker(Stability AI):后置过滤、基于 CLIP 语义匹配,对文本嵌入层面的恶意扰动感知滞后
-
DALL·E 系统级审核:多层规则过滤,基于确定性策略,容易被提示拆分、语言混淆等技巧绕过
-
DiSCO:以输出分布作为引导信号,通过对比优化寻找与原意等价的安全提示,属于前置、动态、模型无关防御
“通过分布引导的对比提示优化,在保留原始意图的前提下对提示进行安全改写,从而在不重训练模型的情况下提升文本到图像生成的安全性。”
— DiSCO 论文团队(arXiv),DiSCO: Defending Text-to-Image Generation through Distribution-Guided Contrastive Prompt Optimization
对行业而言,DiSCO 提供了一个工程化方向:安全能力可以从每家模型的训练流程中解耦出来,变成独立的安全中间件,由服务商或合规中间层统一集成,显著提高攻击者绕过整体生态的成本。
局限、挑战与展望
提示级防御并非终点。攻击者仍可通过更复杂的对抗扰动、分布外提示或提示拆分来对抗净化器,守卫与攻击之间的博弈会持续升级。
政策约束
欧盟 AI Act 已将通用大模型纳入透明性与风险自评义务
生成式 AI 的内容安全正从合规选项变成准入门槛,独立安全层与可审计防御机制具备明确集成空间。
未来方向,DiSCO 一类方法有望演进为“安全提示预处理器”,与水印追溯、来源检测、检索增强等手段叠加,构成覆盖提示端、生成端、输出端的多层防御体系。