ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

边解边变的问题:从“决策依赖“一词出发

边解边变的问题:从“决策依赖“一词出发 TL;DR「决策依赖问题」不是一个规范术语但它指向一个真实存在、横跨运筹学、经济学、控制论、博弈论与机器学习的问题家族。这个家族的共同结构只有一句话决策会反馈回问题本身——你的选择会改变你面对的分布、你能获得的信息、他人的优化问题、乃至数据本身。本文从术语辨析出发定位它在运筹学中的真身决策依赖不确定性区分它最易混淆的邻居预测-优化范式最后展开一张完整的家族地图并给出一句可以检验任何问题的问句。目录从一个不规范的词开始辨义这个词可能指向哪里真身决策依赖不确定性邻居预测-优化范式拉远整个家族一张地图一句检验参考文献一、从一个不规范的词开始所有精确的概念都有一个不精确的起点。设想有人问“有没有一种东西叫决策依赖问题”这个问题有趣的地方在于这个词查无出处——你在任何教科书的索引里都找不到它的规范定义。但它又不像是生造的因为它的每一个音节都指向某种真实的东西。本文记录把这个概念钉死在地图上的过程先排除两处相邻的地层找到主矿体再沿着矿脉四下张望最后发现——这东西比想象中大得多。二、辨义这个词可能指向哪里在非正式用法里决策依赖有两处常见落点。心理学依赖型决策倾向。指难以独自做决定、需要他人持续提供建议和保证才能完成选择的行为倾向。它不是独立的临床诊断当倾向严重到病理程度时对应的是依赖型人格障碍症状包括让别人为自己做大多数重要决定。近旁的概念还有决策疲劳长期回避选择导致决策能力退化与决策瘫痪对后果的灾难化想象导致无法行动。经济学路径依赖。由 David1985提出、经 North 系统化为制度变迁理论的正式概念系统一旦进入某条路径就会被规模经济、学习效应等自我强化机制锁定即使存在更优替代方案也难以突破。QWERTY 键盘击败效率更高的德沃夏克键盘是它的经典案例。而本文的主线是它在运筹学中的那处落点——那里有一整个研究方向。三、真身决策依赖不确定性3.1 经典随机规划的隐含假设不确定性下优化的标准范式是这样一条链选一个决策 x → 随机因素 ξ 实现 → 得到结果 → 选 x 使期望结果最好它有一个默认假设ξ 的分布 P 是自然给定的、固定的与你做什么无关。以报童问题为例明天的报纸需求是随机的但这个需求的分布是客观存在的。你订 100 份还是 500 份都不会改变明天有多少人想买报纸这个规律。用一句话说你的决策只是在被动地应对随机性。而决策依赖不确定性decision-dependent uncertaintyDDU又称内生不确定性endogenous uncertainty打破的正是这个假设——决策与随机机制之间长出了一条反向的箭头。3.2 三种箭头箭头落在哪含义典型例子概率分布随机参数的分布随决策改变RD 投资额决定项目成功概率信息结构不确定性何时、是否被揭示取决于决策只有钻井之后才知道油田储量不确定集鲁棒优化中的不确定集随决策变化安全投入越多损失的不确定集越小箭头落在分布上RD 项目组合是经典场景——投 500 万项目成功率 20%投 2000 万成功率 60%。项目成功与否这个随机事件的分布是你自己选出来的。此时目标函数里的期望不再是固定的E ξ [ ⋅ ] \mathbb{E}_\xi[\cdot]Eξ​[⋅]而是E ξ ∼ P ( x ) [ ⋅ ] \mathbb{E}_{\xi \sim P(x)}[\cdot]Eξ∼P(x)​[⋅]——连在哪个分布下取期望都取决于你。箭头落在信息上海上油气田开发是奠基性案例——地下储量是个客观事实但你不钻井就永远不知道。钻井这个决策本身打开了信息的闸门。于是问题的性质变了你不仅在选择做什么还在选择花多少钱去知道什么。这类问题的决策往往分阶段先钻探买信息→ 看到结果 → 再定开发规模。临床试验排程、地质勘探、市场测试都是这个模式。它的祖先可以追溯到 Weitzman1979的潘多拉盒子问题只有打开盒子才能看到盒子的价值。3.3 为什么这类问题特别难非凸性经典设定下若Q ( x , ξ ) Q(x,\xi)Q(x,ξ)对x xx凸则期望也凸分布本身依赖x xx之后目标函数一般变为非凸、甚至非连续情景树失效情景树方法假设信息按时间自然展开但这里信息是否被揭示本身取决于你的行动——非预期性约束被污染标准的情景分解算法直接不可用算法需要重造析取规划重构、拉格朗日分解、定制的分支定界与有效不等式都是为这条箭头付出的代价。3.4 一句话定义普通随机优化研究在给定的不确定性面前如何最优行动。DDU 研究当你的行动本身会改变你所面对的不确定性时如何行动。打个比方前者是在固定的牌桌上打牌后者是你的打法会改变牌堆里还剩什么牌。四、邻居预测-优化范式描述到这里容易产生一个误解——“这类问题是不是就是一个预测加一个优化”4.1 一个预测 一个优化确实是一个范式它叫预测-优化predict-then-optimizePTO结构正如字面数据 →预测模块→ 预测出参数 →优化模块→ 决策当优化问题里的参数本身未知明天的需求、路况、客户违约概率就用机器学习先预测这些参数再代入优化模型求解。预测每条路的通行时间 → 车辆路径优化预测需求 → 库存优化。它的升级形态叫决策导向学习decision-focused learningDFL。这条线研究的核心痛点是预测得好 ≠ 决策好。用 MSE 训练预测模型但预测误差落在哪个方向、对下游决策的代价天差地别——需求预测偏高 10 件可能只是多压点货预测偏低缺货损失可能是它的十倍。于是 DFL 干脆把优化层放进训练循环让预测模型直接以最终决策有多差为目标来学。4.2 知识问题 vs 结构问题但 PTO 不是 DDU。区别在于箭头的方向预测-优化PTO/DFL决策依赖不确定性DDU不确定性的性质外生、参数未知知识问题内生、被决策改变结构问题整体形状流水线数据→预测→优化→决策到此为止闭环决策→改变分布/信息→面对新的不确定性若参数全知退化为普通确定优化仍是随机问题且分布的形状由你选核心研究内容预测误差与决策损失的错配反馈导致的非凸性、信息揭示的建模用报童问题做同病不同源的对照最直观你的报摊不知道明天需求的分布用历史数据训练模型预测需求——这是 PTO 问题你在短视频平台投放广告投放力度直接改变明天的需求分布——这是 DDU 问题。同一个问题外壳两种病。关键是这两种病可以同时得——既要预测分布未知又依赖决策改变分布。它们是正交的维度可以叠加近年也确实有工作把它们合在一起处理。4.3 两者之间的桥有一个概念恰好站在交界处表演性预测performative predictionPerdomo et al., 2020——你部署一个预测模型人们依据它行动行动改变了数据分布于是模型面对的分布被模型自己扭曲。从机器学习那侧看它是 PTO 的闭环化从运筹那侧看它就是决策依赖分布的特例决策 部署哪个模型。五、拉远整个家族一旦习惯了寻找那条指回来的箭头你会发现它无处不在——横跨经济学、金融、控制论、博弈论、机器学习。分类标准只有一个箭头落在什么上面。5.1 落在分布上你的行动改写你面对的随机规律卢卡斯批判宏观经济学1976用历史数据估出的经济关系来设计政策政策本身会改变这条关系——你脚下的地图你一踩就过期。它可以看作表演性预测的经济学老祖宗。市场冲击金融Almgren–Chriss、Kyle 模型你下多大的单价格就被你推多少。大基金把大单拆成小单慢慢买本质就是内化了自己对价格分布的影响。古德哈特定律 / reward hacking指标一旦成为优化目标行为分布就围绕指标重组与真实目标脱钩——强化学习里那个发现原地绕圈刷分比冲线得分更高的赛艇游戏智能体是经典一幕。同族自我实现的预言预言银行挤兑反而引发挤兑、平均场博弈每个人的决策共同构成所有人面对的平均分布。5.2 落在信息上你的行动本身就是侦察行动双重控制dual control控制理论1960s控制信号有双重作用——既驱动系统又试探系统以降低参数不确定性。何时稳稳地控制、何时故意扰动去学习是控制论版的探索-利用。多臂老虎机 / 贝叶斯优化 / 主动学习 / 最优实验设计拉一次杆的价值一半在收益一半在信息。贝叶斯劝服 / 信息设计Kamenica Gentzkow, 2011走到极致的情形——你优化的对象干脆就是别人能看到什么信息。5.3 落在他人的优化问题上你的决策是他人世界的一部分双层优化 / Stackelberg 博弈领导者选 x追随者在 x 给定下解自己的优化问题领导者预判这一切再选。LAX 机场的安保调度系统ARMOR是这个框架的真实部署。机制设计“逆向博弈论”2007 年诺奖方向你优化的变量是游戏规则本身所有参与者的行为——即结果的分布——是对规则的均衡反应。5.4 落在数据上你手里的样本是你自己造出来的强化学习策略决定你访问的状态分布——RL 之所以比监督学习难根源就是这条回路。离线策略评估 / 选择偏差旧策略下收集的数据天然偏袒旧策略拿它评估新策略会系统性跑偏。对抗适应垃圾邮件过滤器一部署垃圾邮件制造者随即调整策略——一场围绕你模型展开的分布军备竞赛。5.5 为什么它们是一家人两条深层共性。数学上它们最终都归结为不动点 / 均衡问题解一个优化 → 环境响应 → 旧解失效 → 再解……稳定的解是这条循环的驻点。表演性预测里叫 performatively stable point博弈论里叫均衡计量经济学里叫联立方程的一致解——同一件事的不同方言。因果上它们都在同一个地方翻车数据告诉你的是P(结果 | 观察到 x)而优化需要的是P(结果 | 由我做 x)。凡是你自己站在因果环路里的地方这两个量就会分叉。predict-then-optimize 流水线在这些场景里系统性失灵正是因为它偷偷假设了两者相等。六、一张地图一句检验箭头落在哪代表问题大本营概率分布卢卡斯批判、市场冲击、古德哈特定律经济学、金融信息结构双重控制、老虎机、信息设计控制论、运筹他人的优化问题双层优化、机制设计博弈论、运筹数据分布RL 探索、离线评估、对抗适应机器学习判断任何一个问题是否属于这个家族只需要问一句“把我的决策固定住我面对的世界会不会不一样”——如果会你就在这张地图上。世界上的问题分两种一种是你把决策固定住、世界还是原来那个世界的问题另一种是你把决策固定住、世界已不再是原来那个世界的问题。后者是本文的主题——它们更难因为每当你伸手问题本身就在移动。参考文献Jonsbråten, T. K., Wets, R. J.-B., Woodruff, D. L. (1998). A class of stochastic programs with decision dependent random variables.Operations Research, 46(3).Goel, V., Grossmann, I. E. (2006). A class of stochastic programs with decision dependent uncertainty.Annals of Operations Research, 142.Solak, S., Clarke, J.-P. B., Johnson, E. L., Barnes, E. R. (2010). Optimization of RD project portfolios under endogenous uncertainty.European Journal of Operational Research, 207(2).Hellemo, L., Barton, P. I., Tomsgard, A. (2018). Decision-dependent probabilities in stochastic programs with recourse.Computational Management Science, 15.Apap, R. M., Grossmann, I. E. (2017). Models and computational strategies for multistage stochastic programming under endogenous and exogenous uncertainties.Computers Chemical Engineering, 103.Weitzman, M. L. (1979). Optimal search for the best alternative.Econometrica, 47(3).Donti, P. L., Amos, B., Kolter, J. Z. (2017). Task-based end-to-end model learning.NeurIPS.Elmachtoub, A. N., Grigas, P. (2022). Smart “predict, then optimize”.Management Science, 68(1).Perdomo, J., Zrnic, T., Mendler-Dünner, C., Hardt, M. (2020). Performative prediction.ICML.Kamenica, E., Gentzkow, M. (2011). Bayesian persuasion.American Economic Review, 101(6).Lucas, R. E. (1976). Econometric policy evaluation: A critique.Carnegie-Rochester Conference Series on Public Policy, 1.Feldbaum, A. A. (1960–1961). Dual control theory (I–IV).Automation and Remote Control.Almgren, R., Chriss, N. (2001). Optimal execution of portfolio transactions.Journal of Risk, 3(2).Kyle, A. S. (1985). Continuous auctions and insider trading.Econometrica, 53(6).David, P. A. (1985). Clio and the economics of QWERTY.American Economic Review (Papers Proceedings), 75(2).North, D. C. (1990).Institutions, Institutional Change and Economic Performance. Cambridge University Press.
返回列表