arXiv · 2025 对抗评测 安全实战

FraudBench 现身 arXiv:银行 AI 智能体迎来对抗性欺诈压力测试,AI 安全评测转向实战化

大模型驱动的银行智能体正在进入真实业务,其最大风险不是能力不足,而是在自适应欺诈攻击下能否坚守既定策略——FraudBench 的出现,把 AI 安全评测从「考能力」推向「打实战」。
攻击源 · 自适应演化
v₁
v₂
vₙ
迭代累积 · 攻击自我更新
🏦
银行智能体 · 策略遵循核心 Policy‑Grounded Agent
策略遵循刻度
62% 0 100
↳ 指针右偏 = 偏离策略信号 · 暴露偏离,而非表扬能力
FraudBench 测试的核心不是智能体解决问题的能力,而是面对欺诈时,AI 能否恪守既定业务策略。关键词在于「自适应」:攻击并非一成不变的模板,而是会根据智能体的防御表现动态演化。
范式转向

从静态能力测试到自适应对抗压力

静态基准与对抗式评测的差异,正对应 AI 安全研究的两代思路:
静态基准 给定固定题库考察模型能力上限,结果可复现但容易被针对性优化,无法反映真实恶意环境;
对抗式基准 引入随防御演化而调整的自适应攻击者,考察部署场景中的真实鲁棒性,结果更接近实战。

大模型 Agent 正从客服、问答等低风险场景,向交易辅助、风控决策、合规审查等权限敏感的环节渗透。权限越高,「策略遵循」就越关键——AI 一旦在欺诈诱导下偏离既定规则,后果会从「回答错误」升级为「资金损失」。

FraudBench 是 AI 安全评测向实战化演进的一个明确信号:大模型智能体的竞争力,将从「谁更聪明」转向「谁更经得起攻击」。对于正在把 Agent 推向生产环境的银行与金融科技机构,这类基准值得被当作部署前的安全门槛来对待。
抗打击韧性 · 安全门槛 自适应压力测试 · 部署前必测