学新漏洞就忘旧漏洞:频率感知持续学习,破解审计大模型的"健忘症"
大语言模型做智能合约漏洞检测,最大的工程障碍不是识别能力,而是"健忘"——学会新漏洞类型,旧漏洞的检测能力就明显回退。近日一篇公开论文提出频率感知持续学习框架,用"经验回放 + 风险加权采样"同时保住新旧两类知识,给审计大模型装上可持续升级的能力。
注:以上为行业公开讨论中的量级数据,用于理解问题规模;具体数字随年份与统计口径浮动。
发布平台:公开预印本平台 · 学术论文
大语言模型做智能合约漏洞检测,最大的工程障碍不是识别能力,而是"健忘"——学会新漏洞类型,旧漏洞的检测能力就明显回退。近日一篇公开论文提出频率感知持续学习框架,用"经验回放 + 风险加权采样"同时保住新旧两类知识,给审计大模型装上可持续升级的能力。
注:以上为行业公开讨论中的量级数据,用于理解问题规模;具体数字随年份与统计口径浮动。
智能合约锁定的链上资产以千亿美元计,而"代码即法律"意味着——一经部署,难以修改。漏洞不是缺陷,是直接的资金损失。过去几年,跨链桥、借贷协议、治理模块轮番出事,每年因智能合约被窃的资产都在 20 亿美元量级。
防御侧的窘境是:漏洞形态,比防御工具进化得快。
传统防线卡在三难里:静态分析速度快但误报率高,人工复核成本惊人;形式化验证精确但昂贵,只负担得起核心模块;人工审计可靠,但一份合约动辄数周、报价数万到数十万美元。市场等的是一个能规模化、还能持续进化的检测器。
注:以上为行业公开讨论中常见引述的量级数据,用于理解问题规模;非论文原测结果,具体以年度报告口径为准。
大语言模型的代码理解能力,让审计行业看到了转折点——LLM 能读懂注释与业务意图,能跨文件追踪调用链,初筛能力远超传统规则。但转折点旁边,埋着一个被低估的问题。
模型会"忘"。
漏洞类型从来不是静态清单:新的攻击模式、新的协议标准、新的合约语言不断出现。让模型认识新漏洞,就必须更新它。而直接在新数据上微调,模型对已学漏洞的检测能力会明显回退——这就是灾难性遗忘。全量重训能保住旧知识,但成本高、周期长,还要面对审计数据敏感、无法随意流转的现实。而对安全场景来说,"旧漏洞随时复活"是常态,遗忘不可接受。
遇到新漏洞类型,直接在新数据上微调,或全量重训。前者旧能力回退,后者成本不可控——审计数据涉密,重训还要过合规关。
增量更新 + 经验回放 + 频率加权。新漏洞特征被吸收,旧漏洞知识被巩固,检测能力呈单向增长,而不是按下葫芦浮起瓢。
注:对比为方法论层面的归纳,用于定位论文在技术路线中的位置,非论文原文内容。
持续学习本身不是新概念,方法库里有重放、正则化、参数隔离等成熟路线。这篇论文的关键词落在"频率感知"上——一个朴素却容易被忽视的原则:
样本多,不代表风险高。
直觉上,重入攻击的样本最多,模型对它最熟;但真正让安全团队夜不能寐的,往往是那些极少出现、一出现就归零的漏洞类型——预言机依赖、治理攻击、新型跨链模式。频率感知采样做的,就是把回放权重向这类漏洞倾斜,让它们在训练中不被主流样本淹没。
注:上图为示意结构,只用于说明"按风险频率而非样本数量分配记忆资源"这一核心思想;具体权重配置与实验数据以论文原文为准。
新知识进来,旧知识不塌。
对审计场景来说,这个"不塌"的价值,比一次基准刷新更值得看重——它意味着模型可以在真实攻击事件发生后持续吸收教训,而不会以牺牲旧防线为代价。
这套机制落到审计行业,能改变什么?
这篇论文值得关注,但不必神话。频率感知解决的是一个真实且致命的工程问题,但它不是万能钥匙。
LLM 的代码能力,正在从"写"转向"守"。
持续学习真正的价值,是让安全模型第一次拥有长期服役的资格——一个会退化的守卫,不值得托付资产。
但请记住:真正未知的漏洞,依然要等攻击者先演示一遍。
论文以公开预印本形式发布,检索标题即可获取全文。工程团队不必等官方实现——"经验回放 + 频率加权"的思路,完全可以在自己的私有审计数据上先行复现。
阅读路径 · 公开预印本平台 检索论文标题 适合读者:安全研究员 · 智能合约审计团队 · 区块链基础设施开发者