ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

指数分布、伽马分布与泊松分布:泊松过程视角下的统一解读

指数分布、伽马分布与泊松分布:泊松过程视角下的统一解读 1. 从同一段故事出发到达间隔、等待队列与事件计数我最早把这三者彻底搞明白是在一次等奶茶的排队中。收银台每秒可能有零到几个人到达两个顾客之间的空档时长以及我前面排着的队伍需要清空的时间看起来是三个完全不同的问题但它们的概率规律恰好是同一棵树上长出来的三根枝杈。这正是概率论里一个有点反直觉又极其优雅的地方指数分布、伽马分布与泊松分布其实是同一个随机到达过程从不同角度观察得到的结果。很多人学到这三个分布时最头疼的是它们长得不像指数分布的概率密度是一条从最高点衰减的曲线伽马分布是一条带形状参数的偏态曲线泊松分布则是离散的柱状图。于是大家习惯性地把它们当三个独立知识点去背背完就忘忘了再背。实际上只要抓住一个共同的故事背景三者的关系完全不需要死记硬背。这个故事背景就是泊松过程。假设某个事件在时间轴上是随机发生的它满足三个条件任意两段不重叠的时间区间内事件发生次数互相独立在足够小的时间段里发生超过一次事件的概率趋近于零事件发生的速率恒定记作 $\lambda$。这就是标准的泊松过程。在这个过程里相邻两次事件之间的时间间隔 $T$比如奶茶店连续两个顾客进门的间隔服从指数分布等到第 $k$ 次事件发生的总时长 $S_k$比如等到第 10 个顾客进门的耗时服从伽马分布单位时间内事件发生的次数 $N(t)$比如一分钟内进店的人数服从泊松分布。这三个量本质上是同一串随机事件的时间表达和计数表达。你可以理解为指数分布回答下一个事件什么时候来伽马分布回答第若干个事件什么时候来泊松分布回答一段时间里来了多少个。这篇文章我就围绕这个框架展开把每个分布的来龙去脉、推导线索和参数关系全部打通。无论你是刚学概率论的学生还是做数据分析、算法模型时天天跟这些分布打交道的从业者这篇文章能帮你省下大量翻书对公式的时间。2. 指数分布为什么无记忆性是整栋楼的地基2.1 无记忆性到底在说什么指数分布是所有连续分布里唯一具有无记忆性的分布。这句话初学者往往听过就忘但它恰恰是整个泊松过程框架的起点。无记忆性的数学表达是$$P(T s t \mid T s) P(T t)$$意思是已知某个事件已经等了 $s$ 秒还没发生那么它再等 $t$ 秒以上的概率和从零开始等 $t$ 秒以上的概率完全相同。也就是说已经等待的时间不提供任何信息。这就像排队时有人告诉你前面那位已经等了十分钟但这不影响你预估自己还得等多久——因为到达间隔的分布本身不记得已经过去的时间。这个性质放在现实里其实很苛刻。机器零件的寿命通常不服从指数分布因为用了很久的零件确实更容易坏它有记忆人的排队等待时间也不完全服从指数分布因为队伍越长新顾客可能越不愿意来。指数分布只适用于事件随机无状态地发生的场景比如理想化的顾客到达、原子衰变、电话呼叫到达。2.2 从泊松过程推导指数分布指数分布并不是凭空定义的它是泊松过程的直接推论。设 $N(t)$ 是 $[0,t]$ 时间内事件发生的次数泊松分布给出$$P(N(t) 0) e^{-\lambda t}$$第一个事件发生的时间 $T_1$它大于 $t$ 等价于 $t$ 时刻之前一个事件都没发生。于是$$P(T_1 t) P(N(t) 0) e^{-\lambda t}$$所以 $T_1$ 的分布函数为 $1 - e^{-\lambda t}$概率密度为 $\lambda e^{-\lambda t}$。这就是指数分布。注意这个推导完全不需要额外假设指数分布是泊松过程的时间间隔表达。这里 $\lambda$ 同时是泊松过程的速率也是指数分布的速率参数它俩共用同一个参数不是巧合而是同一个过程的两种视角。2.3 指数分布的均值、方差与参数陷阱指数分布写作 $T \sim \text{Exp}(\lambda)$其中 $\lambda$ 是速率参数表示单位时间内事件发生的平均次数。它的期望是 $1/\lambda$方差是 $1/\lambda^2$。这里有一个几乎所有人都会踩的坑有些教材用 $\lambda$有些用 $\theta 1/\lambda$ 作为尺度参数。R 语言里rexp(n, rate λ)Python 的numpy.random.exponential(scale 1/λ)如果没搞清楚参数定义模拟结果会差得离谱。我在实际业务中曾经需要估计服务器请求的平均间隔拿到数据后直接套了np.random.exponential(5)以为 5 是平均间隔其实它当成 scale 用了生成的数据均值是 5而我原本想要的均值是 0.2。整整浪费了半天排查最后发现是参数化方式的锅。所以看到任何函数、任何代码里的指数分布第一件事就是确认它的第二个参数是 rate 还是 scale。更直观的理解速率参数 $\lambda$ 越大事件发生越频繁间隔期望 $1/\lambda$ 越小密度函数衰减越快。如果把 $\lambda$ 当成单位时间的平均次数$1/\lambda$ 就是平均每两次事件的间隔这两者永远是互为倒数的关系。3. 伽马分布把多个指数变量加起来的自然结果3.1 两个指数之和开始变形回到奶茶店的例子。单个顾客到达间隔服从指数分布那么第二个顾客到达要等多久它是两个独立指数变量之和即 $S_2 T_1 T_2$。两个独立指数变量的和的密度函数怎么求可以用卷积$$f_{S_2}(t) \int_0^t \lambda e^{-\lambda x} \cdot \lambda e^{-\lambda (t-x)} dx \lambda^2 t e^{-\lambda t}$$这个函数在 $t0$ 处取值为 0先上升再下降已经不再是单调递减的指数形态了。如果把 $k$ 个指数变量加起来会得到$$f_{S_k}(t) \frac{\lambda^k}{\Gamma(k)} t^{k-1} e^{-\lambda t}$$这就是伽马分布。其中 $k$ 是形状参数$\lambda$ 是速率参数或率参数$\Gamma(k)$ 是伽马函数它是阶乘在实数域的推广$\Gamma(k) (k-1)!$当 $k$ 为正整数时成立。所以伽马分布最本质的来历一句话就能说清它是 $k$ 个独立同分布指数变量之和的分布。这个关系不是某种数学巧合而是泊松过程内部结构的必然结果。等第 $k$ 个事件发生你的等待时间由 $k$ 个独立、相同的随机间隔共同组成每个间隔都服从指数分布加起来自然就是伽马。3.2 形状参数、尺度参数与速率参数的对应关系伽马分布有两种主流的参数化方式这也是一个容易混淆的雷区参数化方式概率密度函数均值方差典型场景形状 $k$ 速率 $\lambda$$\frac{\lambda^k}{\Gamma(k)}t^{k-1}e^{-\lambda t}$$k/\lambda$$k/\lambda^2$泊松过程推导、排队论形状 $\alpha$ 尺度 $\theta$$\frac{1}{\Gamma(\alpha)\theta^\alpha}t^{\alpha-1}e^{-t/\theta}$$\alpha\theta$$\alpha\theta^2$贝叶斯统计、保险精算两者关系就是 $\theta 1/\lambda$。同样一个分布在 Python 的scipy.stats.gamma里默认使用形状参数a和尺度参数scale在 R 的dgamma(x, shape, rate)里默认使用速率参数。写代码做模拟时如果混用了这两套体系得到的曲线完全对不上。形状参数 $k$ 的整数性也有讲究。如果 $k$ 是正整数伽马分布又叫厄兰分布这时它可以被看作 $k$ 个指数分布之和如果 $k$ 不是整数比如 $k0.7$ 或 $k3.2$它依然是一个合法的分布但此时的指数变量之和解释就不成立了它只是把阶乘推广到实数域后的一个平滑插值结果。3.3 伽马函数与分布背后的直觉很多人第一次看到伽马函数 $\Gamma(k)$ 时觉得莫名其妙为什么密度函数里要除以这么个东西其实它只是归一化常数。$t^{k-1}e^{-\lambda t}$ 在 $t \geq 0$ 上积分并不等于 1除一个 $\Gamma(k)/\lambda^k$ 才能让总面积是 1。简单理解$e^{-\lambda t}$ 负责让密度在无穷远处衰减到零$t^{k-1}$ 负责控制密度在原点附近的增长形态而 $\Gamma(k)$ 只是配平用的。形状参数 $k$ 每增加 1就相当于在概率上多叠加一个指数等待。所以 $k1$ 时伽马分布就是指数分布$k$ 增大时分布越来越往中间集中偏态减小逐渐接近正态分布的形态。这是中心极限定理的体现多个独立随机变量之和的分布趋于正态伽马分布正是这条路上一个经典的中间站。4. 泊松分布计数视角与伽马分布的积分之约4.1 泊松分布如何从伽马分布中推出来很多人没注意到泊松分布和伽马分布之间存在一个非常漂亮的积分关系。设 $N(t)$ 是 $[0,t]$ 内事件发生的次数$S_k$ 是第 $k$ 次事件发生的时刻那么关键的事件等价关系是$$N(t) \geq k \iff S_k \leq t$$这句话的意思是$t$ 时刻之前至少发生了 $k$ 次事件等价于第 $k$ 次事件的到达时刻早于 $t$。这个等价关系是整个推导的枢纽。于是$$P(N(t) k) P(N(t) \geq k) - P(N(t) \geq k1) P(S_k \leq t) - P(S_{k1} \leq t)$$把 $S_k$ 服从伽马分布代入展开积分$$P(S_k \leq t) \int_0^t \frac{\lambda^k}{\Gamma(k)} x^{k-1} e^{-\lambda x} dx$$而 $P(S_{k1} \leq t)$ 就是 $P(S_k \leq t)$ 减去多出来的那一小段。用分部积分一步步化简最后会得到$$P(N(t) k) \frac{(\lambda t)^k e^{-\lambda t}}{k!}$$这就是泊松分布的质量函数。这个推导过程可能稍显繁琐但结论非常重要泊松分布是伽马分布也就是指数分布之和在计数视角下的镜像。一个描述第 $k$ 次事件何时发生一个描述到 $t$ 时刻发生了几次它们是同一个随机过程的两个坐标轴。4.2 为什么均值和方差都会等于 λt泊松分布最著名的特征之一就是均值等于方差都是 $\lambda t$。如果以单位时间计数就是 $E[N(t)] \lambda t$$\text{Var}[N(t)] \lambda t$。这个性质的直观解释来自 $\lambda$ 的双重身份作为速率参数它在地基层面决定了指数分布的期望间隔 $1/\lambda$作为泊松参数它又直接是单位时间计数的期望。所以当你估计出数据的均值等于方差可以考虑泊松模型当你发现方差显著大于均值也就是过离散现象就需要引入负二项分布等替代方案。我见过不少同学在分析用户行为数据时看到计数数据的均值和方差差不多就放心地用了泊松回归结果残差诊断一塌糊涂。后来仔细看才发现数据里混了几个极端活跃用户把方差抬高了。这时候更合适的做法是使用负二项分布它本质上是伽马混合泊松即泊松分布中的 $\lambda$ 本身服从伽马分布。你看绕了一圈又回到伽马了这些分布之间的血缘关系远比名字看起来亲近。4.3 泊松分布和指数分布的直接连系除了通过伽马分布间接相连泊松和指数还有一个更直接的连系在泊松过程中给定 $[0,t]$ 内发生了 $N(t) n$ 次事件那这 $n$ 个事件发生的具体时刻在条件上服从 $[0,t]$ 上的均匀分布。这个结论有时候被称为泊松过程的均匀性。它意味着如果只知道单位时间里来了 $n$ 个人却不知道具体几点来的那么这些人的到达时刻在时间轴上没有任何偏向。这个性质在很多工程场景中特别有用。比如你在做仿真时已知一小时内会有 60 个请求到达你不用一句一句按照指数间隔生成而是可以直接在这一个小时内均匀地撒 60 个点效果是完全等价的。我最早做排队仿真时就是先按泊松分布生成每个小时的请求总数再在小时内均匀撒点速度比逐步模拟指数间隔快了一个数量级。5. 矩母函数视角三种分布的代数统一5.1 用矩母函数一页纸看穿三个分布如果说前面的故事是直观层面那么矩母函数就是代数层面的一页纸证明。矩母函数是 $M_X(u) E[e^{uX}]$。把它算出来就能同时读出各阶矩也能用来判断独立变量之和的分布。三个分布的矩母函数分别是指数分布$M_T(u) \frac{\lambda}{\lambda - u}$要求 $u \lambda$伽马分布$M_{S_k}(u) \left(\frac{\lambda}{\lambda - u}\right)^k$泊松分布$M_{N(t)}(u) \exp\left(\lambda t(e^u - 1)\right)$从这三个式子能看出什么第一伽马分布的矩母函数是指数分布的矩母函数的 $k$ 次方。而独立随机变量之和的矩母函数等于各自矩母函数的乘积所以 $k$ 个独立指数变量之和的矩母函数确实是 $\left(\frac{\lambda}{\lambda - u}\right)^k$。这再次验证了伽马分布的指数之和身份。矩母函数的乘积性质让多个等待相加这个操作变成了一次方运算非常清爽。第二泊松分布的矩母函数形式完全不同带有 $e^u - 1$ 的结构这源于它作为计数分布的离散特性。虽然代数形式不一样但前面已经说过它和伽马分布通过积分关系相连矩母函数只是另一个观察视角不会改变结论。5.2 从泊松到指数再到伽马全套推导链把整套关系的推导链完整梳理一遍你会发现每个环节都严丝合缝从泊松过程的假设出发$N(t)$ 服从泊松分布直接推出第一个事件到达时刻 $T_1$ 服从指数分布由指数分布的无记忆性第 $k$ 个事件的到达时刻 $S_k T_1 T_2 \dots T_k$是 $k$ 个独立指数变量之和因此服从伽马分布反过来给定 $S_k$ 服从伽马分布通过 $P(N(t) k) P(S_k \leq t) - P(S_{k1} \leq t)$又能推出泊松分布的质量函数。这三步形成一个闭合的环。你从任意一个分布出发沿着泊松过程的结构都能推出另外两个。很多教材把它们分开讲学生看到三个章节三个公式却没有意识到它们本来是一件事。5.3 参数对照表别忘了单位换算如果要用代码把这三种分布放在一起验证参数对应关系是最容易出错的部分。我整理了一个常用的对照表分布常用记号关键参数期望方差参数关系指数分布$\text{Exp}(\lambda)$速率 $\lambda$$1/\lambda$$1/\lambda^2$—伽马分布$\text{Gamma}(k, \lambda)$形状 $k$速率 $\lambda$$k/\lambda$$k/\lambda^2$$k1$ 时退化为指数泊松分布$\text{Pois}(\lambda t)$速率 $\lambda$时间 $t$$\lambda t$$\lambda t$与伽马通过积分关系相连注意这里三个分布的 $\lambda$ 含义完全一致都是单位时间事件发生次数的速率。这是最让人欣慰的地方参数是同一个参数只是被放在三个不同的函数形式里。理解了这一点很多代码里的数字就不会再看不懂了。6. 形状参数为 1伽马退化为指数的临界点与扩展6.1 伽马分布如何吞并指数分布回到伽马分布的概率密度$$f(t) \frac{\lambda^k}{\Gamma(k)} t^{k-1} e^{-\lambda t}$$把 $k1$ 代进去$\Gamma(1) 1$密度变成 $\lambda e^{-\lambda t}$这就是指数分布的密度函数。所以在参数空间里指数分布是伽马分布的一条边界线。这个退化关系在实际建模中经常被利用。你可以把指数分布当成一个特殊伽马分布来处理然后在统一框架里做模型选择。比如拟合数据时如果伽马分布的形状参数估计值接近 1那说明指数模型已经足够好不必引入额外参数。在似然比检验中这就是一个天然的嵌套模型比较$H_0: k1$ 对 $H_1: k\neq1$。6.2 多个指数相加与单次等待的对比从直觉上看$k1$ 时你只等第一个事件分布曲线单调下降最可能的等待时间是 0。但当你等的是第 $k$ 个事件时你几乎不可能在 0 时刻等到它因为必须攒够 $k$ 次事件。这就解释了为什么伽马分布在 $k1$ 时曲线先升后降存在一个正的众数。众数也有解析式$t_{\text{mode}} (k-1)/\lambda$。当 $k1$ 时众数为 0对应指数分布当 $k$ 增大众数右移分布峰值逐渐远离原点。这个变化规律你可以想象成等第 1 个人进来可能很快但等第 10 个人进来必然要花一定时间这个必然的下限就是众数右移的来源。6.3 把伽马当作等待预算来用在很多实战场景里伽马分布最方便的地方在于它可以当作等待预算模型。假设你负责一个客服系统已知每个客服处理一个问题的时间服从指数分布速率 $\lambda$那么一个用户需要连续经过 $k$ 个客服节点时总等待时间就服从 $\text{Gamma}(k, \lambda)$。你可以利用它来计算95% 的用户会在多少时间内走完全部流程这类业务指标。具体计算可以用 R 的qgamma(0.95, shapek, ratelambda)或 Python 的scipy.stats.gamma.ppf(0.95, ak, scale1/lambda)。我当年做流程耗时分析时就是这样估算 SLA 的。有了伽马分布你不用费劲去做蒙特卡洛模拟一个分位函数调用就能给出承诺值。这也是伽马分布被广泛用于保险理赔额建模、降雨量分析、系统响应时间建模的原因——它既能通过形状参数调节偏态又能通过速率参数匹配均值灵活性远超指数分布。7. 贝叶斯统计里的 Gamma-Poisson 共轭看起来不搭其实是天作之合7.1 共轭先验为什么选中了伽马和泊松贝叶斯推断中如果你选择泊松似然 $P(N n \mid \lambda) \frac{e^{-\lambda}\lambda^n}{n!}$并希望给未知速率 $\lambda$ 找一个方便计算的先验分布伽马分布会成为最自然的选择。原因在于后验分布正比于先验乘似然。设先验 $\lambda \sim \text{Gamma}(\alpha, \beta)$密度为 $\frac{\beta^\alpha}{\Gamma(\alpha)} \lambda^{\alpha-1} e^{-\beta\lambda}$乘以泊松似然后$$\lambda^{\alpha-1} e^{-\beta\lambda} \cdot e^{-\lambda}\lambda^n \lambda^{\alphan-1} e^{-(\beta1)\lambda}$$这仍然是一个伽马分布的形式。于是后验分布为 $\text{Gamma}(\alpha n, \beta 1)$。先验是伽马后验还是伽马只是参数更新了这就是共轭的意义。省去了大量数值积分和采样计算的麻烦。这种感觉有点像你整理房间时发现把两堆零件倒在一起它们自动拼成了一个完整的工件。伽马分布的数学结构好像天生就是为泊松似然准备的先验形式的指数部分和后验的指数部分恰好能合并。7.2 一个简单的贝叶斯更新例子假设你在监控一个网站的请求错误率观测到某小时内的错误次数服从泊松分布。你对错误速率 $\lambda$ 的先验是 $\text{Gamma}(a, b)$其中 $a/b$ 是先验均值。如果 $b$ 很大说明先验比较信心足$b$ 很小则先验比较模糊。设先验 $\lambda \sim \text{Gamma}(2, 10)$它表示平均每小时约 0.2 次错误。接下来观测到一小时内有 5 次错误那么后验就是 $\text{Gamma}(25, 101) \text{Gamma}(7, 11)$。后验均值从 0.2 更新到了 $7/11 \approx 0.64$数据明显拉高了速率估计。这个计算只需要一次加法不需要 MCMC不需要任何迭代算法。我在实际监控告警场景中用过这个特性把历史数据的均值作为先验每来一批新数据就快速更新后验实时判断当前错误率是否显著超过历史基线。比起直接用固定阈值告警这个做法对波动有更好的自适应能力减少了大量误报。7.3 Gamma-Poisson 与负二项分布的隐藏链接进一步延伸一下如果对泊松分布的 $\lambda$ 取一个伽马混合即在 $\lambda$ 本身也是随机变量的情况下把泊松的计数边际化掉得到的边缘分布是负二项分布。这个链接在数据科学里特别有用。泊松分布要求均值等于方差真实数据往往过离散。负二项分布多了一个形状参数允许方差大于均值恰好能处理这种过离散。而它的推导起点正是泊松加伽马混合。换句话说你从泊松和伽马的关系出发不仅能理解三个基础分布的三角关系还能自然过渡到更灵活的建模工具。我建议读者在这点上多花一点时间把 $\text{Pois}(\lambda)$ 中 $\lambda \sim \text{Gamma}(r, \frac{p}{1-p})$ 的混合推导写一遍。结果会得到 $P(Nn) \binom{nr-1}{r-1}p^r(1-p)^n$这就是负二项分布。做完这个推导你对分布之间不是孤立的这句话的体会会深很多。8. 实战中常见的误用参数混淆、单位陷阱与建模取舍8.1 最容易踩的坑rate 和 scale 搞反不管你是用scipy、R还是Stan伽马分布和指数分布的参数化方式都是第一个坑。scipy.stats.gamma默认参数是(a, scale)如果你先入为主地以为第二个参数是速率形状参数又没设对模拟出来的曲线会完全不是预期形态。我建议在写代码之前先做一个 sanity check生成 1 万个随机数打印均值和方差和理论值对比。伽马均值是 $k \cdot \theta$方差是 $k \cdot \theta^2$尺度参数化。如果均值不对大概率是参数顺序错了。这个方法虽然土但能省下大量排查时间。8.2 泊松分布的单位时间窗口必须明确泊松分布的参数是 $\lambda t$很多人写代码时只给一个 $\lambda$忘了乘时间窗口。一次事件在一个小时内发生 30 次和在一分钟内发生 30 次对应的 $\lambda$ 差了 60 倍。做业务分析时我强烈建议把所有计数数据统一到同一个时间基准比如每秒请求数或每分钟错误次数。否则你比较两个时间段的数据时数值差异可能仅仅来自时间窗口不同而不是真实的变化。这个看似小的问题在跨团队协作时特别常见A 组给你的是小时级速率B 组给你的是秒级速率放进同一个模型里结果当然乱套。8.3 什么时候用指数什么时候用伽马什么时候用泊松这是建模取舍的问题取决于你要回答的业务问题问题类型选用分布一句话理由下一个事件什么时候发生指数分布事件间隔建模无记忆性第 k 个事件什么时候发生伽马分布多个指数等待之和单位时间内发生多少次泊松分布计数建模均值等于方差计数数据过离散负二项分布伽马混合泊松允许方差大于均值另外有些人会问指数分布和伽马分布之间能不能看数据曲线直接判断可以初步判断如果直方图从零开始单调递减指数模型更合理如果分布先升后降且有明显峰值伽马模型更合理。但更严谨的做法是拟合后做似然比检验或 AIC/BIC 比较因为有限样本的直方图形状存在偶然性。8.4 一个小技巧用模拟交叉验证三种分布的关系最后分享一个我常用的验证方法非常适合新手建立直觉。用 Python 做一个小实验import numpy as np from scipy import stats lam 2.0 k 5 n 100000 # 1. 生成 k 个指数变量求和后拟合伽马 exp_samples np.random.exponential(scale1/lam, size(n, k)) gamma_by_sum exp_samples.sum(axis1) # 2. 直接生成伽马 gamma_direct np.random.gamma(shapek, scale1/lam, sizen) # 3. 模拟泊松过程每小段内按泊松抽计数记录第 k 次事件发生的时刻 samples_by_process [] for _ in range(n): events np.random.poisson(lamlam, size100) # 100 个时间单元 flat_times [] for i, cnt in enumerate(events): flat_times.extend([i np.random.uniform() for _ in range(cnt)]) flat_times.sort() if len(flat_times) k: samples_by_process.append(flat_times[k-1]) print(指数求和均值:, gamma_by_sum.mean()) print(伽马直接抽样均值:, gamma_direct.mean()) print(泊松过程模拟均值:, np.mean(samples_by_process))三条独立路径得到的均值应该非常接近。跑通这个实验后你会真切感受到这三种分布是同一种现象的不同投影这句话的含义。9. 一些后话学分布别只背公式前阵子带一个学弟复习概率论他问了我一个特别好的问题学这么多分布到底有什么用我当时指着他的手机说你打车时的等待时间、你刷到广告的次数、你下单后商家备货的耗时、你 App 里收到推送通知的间隔全都能用这套分布框架来描述。我们做数据分析经常会遇到找一个合适的分布来拟合数据的需求。如果你孤立地背了指数分布、泊松分布、伽马分布的公式遇到实际数据时往往会陷入分布选择的迷茫。但如果你把它们看成一条故事链——泊松过程是唯一的故事主线指数分布描述事件的间隔伽马分布描述几个间隔之和泊松分布描述窗口内的计数——你就掌握了选择模型的直觉先问自己关心的量是间隔还是计数还是若干间隔的总和再问数据是否有无记忆性最后检查参数化方式。我的经验是这个故事框架比背诵任何一张公式表都管用。
返回列表