
该文章提出了一种受扩散模型启发的两阶段方法,用于训练大型语言模型(LLMs)生成序列式澄清问题,以高效获取用户偏好,尤其适用于用户历史信息有限的场景,显著提升了对话推荐系统的个性化能力。一、文章主要内容总结研究背景与问题推荐系统(RS)依赖用户历史交互学习偏好,但新用户或隐私限制会导致偏好信息缺失;对话推荐系统(CRS)可通过LLMs主动提问获取偏好,但生成跨领域、高质量的序列澄清问题仍是挑战。现有简单提示技术虽能让LLM提问,但无法优化问题质量和序列逻辑,需更系统的训练方法。核心方法:两阶段扩散式框架正向过程(Profile Corruption):将完整用户文本 profile 转换为结构化JSON格式,按“从具体到通用”排序信息;为每条信息生成澄清问题,逐步删除已提问对应的信息,直至profile为空,模拟给profile“加噪声”。反向过程(Profile Reconstruction):用正向过程生成的“部分profile-问题”对微调LLM,训练其从“带噪声”的部分profile中生成问题,逐步还原完整profile,即“去噪声”;同时微调另一个LLM作为用户模拟器,根据真实profile回答问题。实验设计与结果数据集与模型:使用