ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position 文章总结与翻译一、文章主要内容本文聚焦扩散大型语言模型(dLLMs)的安全性问题,首次对其安全性能展开系统分析,并提出适配其独特生成特性的安全对齐方法。1. 核心发现:dLLMs的安全不对称性与AR-LLMs的差异:传统自回归大型语言模型(AR-LLMs)的安全对抗集中于“首token控制”,攻击者和防御者均围绕初始token展开博弈,呈现对称态势;而dLLMs从全掩码序列开始,通过多步迭代生成文本,理论上可非顺序填充任意位置token,但实践中存在强烈的顺序生成倾向。关键token定位:实验表明,dLLMs输出的中间token对整体安全性更关键——防御者若对齐中间token,能更有效保障输出安全;而攻击者受模型顺序生成倾向限制,难以操纵中间token,仅能影响初始token,形成“攻击者受限、防御者可控”的安全不对称性。2. 创新方法:Middle-tOken Safety Alignment(MOSA)设计原理:基于强化学习(RL),将模型中间token生成与预定义的安全拒绝模板(含句末token)对齐。该模板可限制有害输出长度,即便初始token被攻破,也能降低整体危害。技术细节:
返回列表