Prompt-Based Value Steering of Large Language Models

Prompt-Based Value Steering of Large Language Models
文章总结与翻译一、主要内容本文聚焦大型语言模型(LLMs)的价值对齐问题,针对模型微调等传统方法静态固化、无法适应动态价值需求的局限,提出了一种基于提示词的价值引导评估流程。该流程无需修改模型参数,通过量化生成文本中目标价值的存在度与增益,评估提示词引导模型输出贴合特定人类价值的有效性。研究以施瓦茨基本人类价值理论(包含仁慈、普世主义、自我导向等十种价值)为基础,结合ValuesNet DeBERTa v3价值分类器与Commonsense-Dialogues对话数据集,以Wizard-Vicuna-13B-Uncensored模型为测试对象,对比了通用基线提示词与明确价值条件提示词的效果。结果显示,后者在所有目标价值上均实现了对齐性能提升,最终综合得分从0.57提升至0.83,验证了仅通过提示词设计即可实现有效的价值引导。二、创新点提出模型无关的价值引导评估流程:无需修改LLM参数,通过量化“价值增益、价值保留、价值损失、价值中立”四类指标,系统评估提示词对目标价值的引导效果,解决了传统评估中受数据集初始价值分布干扰的问题。构建可解释的价值量化评分体系:通过加权公式整合四类指标,引入归一化处理得到[0,1]区间的评分,可直接用于提示词迭代优化,为自动化提示工程提供目标度量标准。验证纯提示词价值引导的可行性:首次明确证明,即使不进行模型微调或动态提示词优化,仅在提示词中明确指定目标价值,即可显著提升模型输出与该价值的对齐度