大模型安全,从“打补丁“到“长在骨子里“
2026年大模型安全领域最核心的转变可以用一句话概括安全不再是模型上线后的补丁而是模型架构中的基因。这个转变的紧迫性来自一个残酷的现实——越狱攻击的成功率居高不下。安全对齐后的大模型面临两个失效模式一方面可能被越狱攻击诱导输出有害内容另一方面又可能过度拒绝正常查询。传统的安全方法试图在两者之间找平衡但往往按下葫芦浮起瓢——降低越狱风险就会增加过度拒绝反之亦然。一、向量对齐从调参数到调方向LLM-VA这项ACL 2026上的工作提供了一个全新的视角。研究人员发现了一个关键的结构性事实大模型把是否回答的决策答案向量和输入是否安全的判断安全向量编码成几乎正交的方向把它们当作两个独立的过程来处理。这个发现的工程意义极其重大。如果这两个向量是正交的那么调整其中一个必然会影响到另一个——这就是越狱-过度拒绝困境的根源。LLM-VA的解决方案是通过闭式权重更新来对齐这两个向量让模型的回答意愿因果地依赖于其安全评估。在12个大模型上的实验表明LLM-VA比最优基线高出11.45%的F1分数同时保留了95.92%的效用。更关键的是这种方法不需要微调不需要架构改动而且能自动适应每个模型的安全偏差。换句话说这是一个即插即用的安全增强方案。二、可审计的潜在推理透明与安全的两难怎么破安全对齐面临的另一个深层矛盾是安全-可审计性困境。基于推理的安全对齐方法通过暴露模型的思维链来实现可审计性——训练时可以监督生成后可以验证。但问题在于这种文本形式的可审计性同时也成了自适应攻击者的优化目标。ALCAAuditable Latent CoT Alignment提出的解决方案是把安全推理过程转移到连续的潜在空间中进行。这样安全推理可以指导无害输出的生成同时消除了容易被攻击者利用的离散文本表面。但这个过程并非黑箱——通过受限的自解码机制模型可以在特定引导下将潜在推理重构为人类可读的文本以供监督。实验表明ALCA将自适应越狱攻击的成功率降低了40%以上。三、从人防到AI防北京周报在一篇评论中提出了一个更宏观的判断过去先开发、后补防护的模式必须彻底扭转。针对高算力、高自主性的前沿大模型应当建立分级准入机制将安全对齐测试、逃逸压力测试作为模型对外开放的硬性前置条件。更重要的是要从人防御机器转向以AI制衡AI。ARMOR则从技术层面给出了一个以AI制衡AI的实例通过 meticulous reasoning 实现安全对齐在所有基准测试中达到了平均有害率0.002的最优安全性能。四、一个判断大模型安全正在从被动防御走向主动免疫。被动防御是出了问题再打补丁——越狱攻击来了就加一层过滤器过度拒绝了就放宽一点阈值。主动免疫是把安全机制嵌入模型的推理过程本身——让模型天生就知道什么该说、什么不该说而不是在生成之后再过滤。LLM-VA的向量对齐、ALCA的潜在推理、ARMOR的推理对齐这三条技术路线虽然路径不同但指向同一个方向安全不应该是一个外挂的护栏而应该是模型推理逻辑的一部分。这条路还很长但方向已经清晰了。