静态基准与对抗式评测的差异,正对应 AI 安全研究的两代思路:
静态基准 给定固定题库考察模型能力上限,结果可复现但容易被针对性优化,无法反映真实恶意环境;
对抗式基准 引入随防御演化而调整的自适应攻击者,考察部署场景中的真实鲁棒性,结果更接近实战。
大模型 Agent 正从客服、问答等低风险场景,向交易辅助、风控决策、合规审查等权限敏感的环节渗透。权限越高,「策略遵循」就越关键——AI 一旦在欺诈诱导下偏离既定规则,后果会从「回答错误」升级为「资金损失」。