
从大脑记忆到提示词压缩:一条被高估的类比,和一个被低估的定位00 结论给 AI 写长 prompt 效果差,通常不是因为「说得太多」,而是因为关键信息被淹没。于是有了 prompt compression:在 token 预算内,保留信息量最大的子集。这件事有两条路:用小模型算困惑度(LLMLingua 系列),或者用纯统计量查表(本文路线)。本文的立场:纯统计路线在通用 benchmark 上打不过训练过的压缩器,这一点没有争议;但它在一个特定生态位上不可替代——需要确定性输出、可审计、且要与 prefix cache 共存的静态上下文压缩。定位没说清楚,整套方案就会看起来像在和 LLMLingua-2 正面竞争,而那是必输的。01 大脑怎么判断「什么重要」:一个类比,不是一个推导先声明边界:下面五个机制是真实的神经科学发现,但从它们推不出任何具体的压缩公式。它们提供的只是「重要性是多因素加权的」这个结构性直觉。任何声称从脑科学「推导」出压缩算法的说法,都是过度声称。第一层:多巴胺奖赏预测误差Schultz 等人 1997 年发现(Science, 275:1593),中脑多巴胺神经元编码的不是奖赏本身,而是实际奖赏与预期奖赏之差。严格形式是时序差分误差:δ_t = r_t + γ·