ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations

Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations 文章总结与翻译一、文章主要内容该文章聚焦视频推荐系统的优化,针对传统视频推荐系统依赖用户定义元数据或专业编码器提取的低级视觉、声学信号,无法捕捉意图、幽默、世界知识等深层语义的问题,提出了一种基于多模态大型语言模型(MLLM)的零微调框架。1. 研究背景TikTok、Instagram Reels等短视频平台兴起,凸显视频推荐系统的重要性,但传统推荐方法存在语义理解不足的局限,例如只能识别“有人在屋顶跳舞”,却无法知晓舞蹈是否模仿20世纪90年代超级英雄风格,难以把握用户偏好背后的深层原因。2. 核心框架利用现成的MLLM(如Qwen-VL、Qwen-Audio)对视频片段生成丰富的自然语言描述,将视频帧、音频信号等多模态信息转化为语义文本。具体通过两阶段处理音频:先借助Whisper提取语音和纹理,再用Qwen-Audio生成包含意图的描述;同时结合视频帧分析,最终将生成的文本经文本编码器处理后,输入协同过滤、基于内容、生成式等标准推荐模型。3. 实验验证在MicroLens-100K数据集(模拟TikTok风格视频的用户交互)上,对双塔模型(Two-Towers)和生成式模型(SASRec)进行测试。结果显示,MLLM生成的特征显著优于传统的视觉、音频和元数据特征,例如双塔模型的HR@10从0.0253提升至0.0405,相对增益约60%,且在30秒以上视频中效果更明显。此外,还测试了更大规模的文本编码器和MLLM,发现基线MLLM已能捕捉关
返回列表