
判断数据从哪里开始错的我这些年反反复复见到新人甚至不少业务方栽在同一件事上产品数据报表里把“用户评分”当数字求了平均值把“年龄”当连续变量塞进回归模型或者拿着两份不同量纲的指标非要比大小。追根溯源多半是在第一步就错了——根本没搞清手里的数据是定性还是定量。这篇内容不绕弯子直接从定性数据和定量数据的识别讲起再落到描述性统计里那些最常用、也最容易被误用的分析手段全程配合例子和实操口径适合刚接触数据分析的运营、产品、市场同学也适合想系统梳理一遍统计基础的分析师。1. 拿到数据先问一句它到底在描述什么数据分析第一步永远不是急着跑模型、画图表而是把手里的数据老老实实分个类。按照统计学里的经典分法数据先分两大类定性数据和定量数据。听起来简单但实际判断时很多人都凭感觉走看到数字就以为是定量看到文字就以为是定性这种直觉在多数时候是错的。1.1 定性数据本质是分类不是数字定性数据也叫分类数据或品质数据它描述的是事物的属性、类别或者特征。关键判断标准就一条数字本身没有大小意义只代表分类标签。比如性别你可以记作1男2女但你绝不能说2比1大更不能算出“平均性别是1.3”再比如省份代码、设备型号、支付方式、职级名称都属于定性数据。定性数据内部还要再细分为两类。一类是定类数据类别之间没有顺序关系像颜色、性别、品牌你把它排列成任何顺序都不影响逻辑另一类是定序数据类别之间有相对高低或前后关系比如满意度里的“不满意、一般、满意”教育程度里的“高中、本科、硕士、博士”这类数据能比大小、能排序但说不清楚等级之间的间隔是多少。注意这两类虽然都属于定性但在后续分析时权限完全不同定序数据可以做“更高/更低”的判断定类数据只能做“是否相同”的判断。1.2 定量数据有单位、有间隔、可以算数定量数据也叫数值型数据特征是数据本身有实际度量意义可以做加减乘除。典型的有收入、年龄、订单金额、响应时长、点击次数。定量数据内部同样分两类离散型和连续型。离散型数据只能取某些特定的整数或有限值比如“一年内的购买次数”你不可能花0.5次连续型数据在某个区间内可以取任意值比如身高、体重、响应时间的毫秒数理论上可以无限细分。这个区分直接影响后面选统计方法比如计算中位数对两种都合适但做某些精确建模时离散和连续的处理方式会很不一样。一个实用的判断口诀定性数据回答“是什么类别”定量数据回答“是多少数量”。实战中还有一个特别容易混淆的场景。比如“年龄”看起来是定量确实也是但在题目设计里如果问你“年龄段是 A. 18-25 B. 26-35”然后再让你分析这时候问卷回收来的其实是定序数据而不是精确年龄因为你丢失了具体数值只保留了等级信息。同样的原始变量、不同的收集方式直接决定了数据是定性还是定量这一点尤其坑人。1.3 为什么要分这么细后续每个操作都依赖这个判断分类不只是一个理论洁癖它直接决定后续的一切。描述性统计里计算平均值只对定量数据有意义算频率和占比主要用在定性数据上做相关分析定量和定量用Pearson相关系数定序和定序用Spearman做可视化的图层选择定性数据适合柱状图、饼图定量数据适合直方图、箱线图、散点图。方向一错后面的所有结论可信度都归零。可以这样想定性数据像汽车的方向盘和挡位——只有状态、模式没有加减速的连续性定量数据像速度表和油量表——有精确刻度和物理单位能算“多多少”“快多少”。你把方向盘拧了两格然后问“平均拧到几格”这就完全跑偏了。2. 定性数据的描述性统计频率、占比和那个不常被提起的众数定性数据的分析工具没有定量数据那么多花活核心逻辑就一条——数个数、算比例。但即使这么简单实操中的偏差依然层出不穷。2.1 频数和频率描述定性的第一语言一组定性数据里每种类别出现的次数叫频数频数除以总数得到频率也就是占比。比如调查100个用户的注册渠道其中App渠道45人、网页渠道35人、小程序20人那频数分别是45、35、20频率分别是45%、35%、20%。这里有一个高频错误用频数直接比较时忽略了总数不一致。A组样本100人某类有60人B组样本200人某类有100人单看频数B组更多但占比反而是A组高。凡是跨组比较定性数据一律先换算成频率或百分比再说话这是铁律。2.2 众数定性数据的“平均值”很多人一想到平均值就默认是算术平均但对定性数据来说平均值根本没有意义真正对应的是众数——出现次数最多的那个类别。比如产品反馈里“加载慢”出现最多那众数就是“加载慢”这是整体用户感受最主要的倾向。众数有个特点要注意它不一定唯一。数据分布可能有两个甚至多个类别次数并列最高这叫双峰或多峰分布这个时候简单说“整体主流偏好是什么”就不够严谨得把这几个众数都摆出来。2.3 做定性数据表格和图表时的注意事项表格展示定性数据常规做法是列出每个类别的频数和百分比并按降序排列方便一眼抓住头尾。图的话柱状图和条形图是最稳的选择饼图最好在类别不超过6-7类时使用类别太多时饼图切得密密麻麻根本没法看。另外针对定序数据有个额外的展示优势可以累计百分比。比如技能等级里“初级、中级、高级”的占比分别是30%、40%、30%那“达到中级及以上水平”的累计占比是70%这个信息在人才结构分析里非常有用。而纯定类数据做累计没有实际意义“华南华东华北的累计占比”基本说明不了什么问题。3. 定量数据的描述性统计集中趋势与离散程度二者缺一不可定量数据的描述性统计是日常分析里用得最多、也最容易飘的地方。常规分析一般分两路走一路看集中趋势回答“数据整体在哪个水平”一路看离散程度回答“数据围绕这个水平波动得有多厉害”。3.1 集中趋势均值、中位数、众数各管一摊均值是最直觉的“平均水平”把所有值加起来除以个数。但均值有一个著名的致命弱点——对极端值极其敏感。100个人的月收入99个人是5000块1个人是5万块算出来均值约5450这个“平均水平”对绝大多数人根本没有参考意义。这种右偏长尾在右侧的分布下均值会被拉高它反映的其实是“总盘子除以总人数”的算术结果而不是“典型个体水平”。中位数是排序后处在正中间的那个值它的优势在于不受极端值干扰。还是刚才那组收入数据中位数是5000这才是更符合“一个典型用户的收入”的直觉值。所以分析收入、房价、时长这类天然右偏的数据时中位数优先于均值。众数在定量数据里也能用尤其是对离散型数据看“最常见的值是多少”。比如分析“每个用户每周打开App的次数”众数是3次均值可能是4.2次众数给出的信息是“最典型的单一行为模式”和均值、中位数互补使用。3.2 离散程度平均值不骗人但平均值会藏东西只看均值容易翻车因为两组数据的平均值可能几乎一样内部结构却天差地别。比如两个渠道的订单处理时长均值都是10分钟但A渠道每一单都稳定在10分钟左右B渠道一半订单2分钟、一半订单18分钟均值一样体验完全不同。所以衡量离散程度的指标不可跳过。最直观的离散指标是极差最大值减最小值计算简单但只用了两个极端点信息量很少。更稳的是标准差和方差——描述的是每个数据点和均值之间的平均偏离程度。标准差越小数据越集中标准差越大波动越剧烈。但标准差有个问题它的量纲和原数据一样比大小没问题想对比两个不同量纲变量的波动程度时就用不了。这时需要掏出变异系数CV也就是标准差除以均值它能做无量纲的比较。举个例子想对比“商品价格”和“日销量”哪个波动更大直接比标准差没意义因为价钱的数字大、销量的数字小量纲不同。但各自算完变异系数之后再比就公平了。3.3 分布形态偏度和峰度判断数据是否“正态”的初步依据描述性统计里另两个常用指标是偏度和峰度。偏度描述数据分布的对称性——偏度为0代表分布对称正偏右偏说明长尾在右侧负偏左偏说明长尾在左侧。峰度描述的是分布“尖”的程度用来衡量数据在均值附近的聚集程度和尾部分布的厚度。为什么要关注这两个指标因为它们决定后续能不能用基于正态假设的统计方法。很多参数检验比如t检验、方差分析要求数据近似正态分布偏度和峰度的绝对值通常作为初步判断依据。注意这里说的是近似很多“完美正态”在实际业务数据里几乎不存在尤其是用户行为类的漏斗数据天然就是偏态甚至长尾分布。大多数情况下看到偏度绝对值大于1或者峰度远超3就要认真考虑数据是否需要做变换对数变换、Box-Cox变换等或者改用非参数方法。4. 描述性统计常规分析的操作框架图、表、指标一起上单独拿一个指标说事是新手最容易干的事——只报一个均值就下结论。描述性统计的常规做法应该是“图表指标”三位一体互相印证才能形成对数据的完整认识。4.1 通用分析流程先画像再细看后对比我的习惯是分为三步走第一步先给整个数据集拍一张“快照”定性数据看类别数、频数表、占比定量数据看样本量、均值、中位数、最小值、最大值、标准差顺手看一下缺失值情况缺失比例高的字段要标记出来。第二步针对关键定量指标做分布透视画直方图或箱线图直观检查分布形态、极值位置、是否存在离群点结合偏度、峰度判断数据是否适合继续做参数分析。第三步按业务维度拆开对比比如按渠道、按用户类型、按时段切分后重复上面的描述性统计这里重点提醒别只看各组的均值一定要把各组的标准差或中位数也列出来否则很容易得出“看起来差不多但实际结构完全不同”的错误结论。4.2 常用图表的选型逻辑图是给人看的选图的本质是让读者用眼睛完成一次快速统计。下面是我常用的选型逻辑定性数据单变量柱状图/条形图看频数或占比饼图类别少时的占比快览定性数据双变量堆叠柱状图看组间构成差异定量数据单变量直方图看分布形态、箱线图看中位数、四分位数、离群点定量数据双变量散点图看相关趋势定量数据分组对比分组箱线图或小提琴图。箱线图值得重点说。一张箱线图把最小值、下四分位数、中位数、上四分位数、最大值以及离群点全画进去了对比多个分组的分布结构时是信息密度最高的单一图表。我几乎在所有探索性分析里都会先来一张分组箱线图很多规律一眼就能看出来再去做复杂的建模方向不会跑偏。4.3 不同数据类型组合下的描述性统计方案速查实际项目中常常是定性定量混在一起这里给出一张我经常引用的对照表方便直接对号入座场景数据类型推荐描述性统计方案用户画像频道构成定类频数、占比、条形图满意度等级分布定序频数、占比、累计占比价格/收入/时长的整体水平定量右偏中位数、四分位数、箱线图转化率波动分析定量连续均值、标准差、变异系数、折线图各渠道订单金额对比定量分组分组箱线图各组均值/中位数/标准差新老用户活跃度对比定量分组独立样本t检验前先做描述性对比这张表的核心思路是数据类型决定统计口径统计口径决定图表和指标所有环节一条线走到头。5. 实战中的高频坑定性定量分析的错用实录再往下聊点真正有价值的东西这些坑我几乎每年都能在评审会上看到值得单独拿出来讲。5.1 均值明明更“高级”为什么我却劝你多报告中位数业务方天然喜欢均值因为“平均”好理解、好汇报。但均值只有在数据分布接近对称时才足够有代表性。很多业务数据——收入、价格、时长、单量——都是右偏分布头部一小部分人拉高了整体均值中位数才是“大多数人的水平”。报告里我的惯例是同时给出均值和中位数并解释为什么两者有差距。均值远大于中位数就说明数据往高值端偏头部效应明显两者接近则说明分布相对对称。这个简单动作能规避掉大量的业务决策误判因为决策者看的往往不是统计形态而是你对数字的解读方式。5.2 离群值到底删不删先搞清楚它是“脏数据”还是“真实极端”分析时遇到离群值总是很纠结。我的经验是不要一刀切先分三类看录入或采集错误比如年龄填了200、金额出现了负数这类属于脏数据直接剔除或修正真实但极端的业务现象比如大促期间的巨额订单这类属于业务真实值要看分析目标决定是否排除系统本身的长尾比如用户分布里天然的少量极重度用户这类是分布的一部分不能随便删。判断方法很简单结合业务上下文看。如果分析“日常客单价”那大促订单可以考虑剔除或单独分组如果分析“总体营收结构”那这部分必须保留。改数据之前一定在分析文档里写清楚“为什么删、删了多少”这是专业素养问题。5.3 百分比和百分点是两个量纲别互相混淆A渠道转化率从5%提升到6%这不叫“提升1%”叫“提升1个百分点pp”如果叫“提升1%”会被人理解为原基础的1%也就是从5%变成5.05%。这一字之差在业务汇报里的偏差非常大。常规做法是把“绝对变化”用百分点表述“相对变化”用百分比表述——上面的例子是提升1个百分点相对提升了20%。两个口径都对但必须说清楚用的哪一个。5.4 分组细看时辛普森悖论随时会跳出来有一种情况特别反直觉整体趋势和分组趋势完全相反。比如新老用户各自的转化率都比上个月高但合在一起的总转化率反而下降了。原因是两组用户的占比结构发生了变化——低转化率的那组用户占比大幅上升把整体拉下来了。这就是辛普森悖论。遇到这种矛盾解决方式只有一个拆开看报告里同时交代“整体”和“分组”两层口径并解释结构变化。不要只挑对自己有利的那一层汇报那是数字游戏不是数据分析。6. 动手写一份高质量描述性统计报告的清单最后给一个可以直接抄作业的报告结构清单。不管是用Excel、Python、SPSS还是R描述性统计报告的骨架是一样的。按这个清单走至少能保证分析完整、结论可信第一层样本说明数据来源、采集时间、样本量、有效性如何缺失值的比例和处理方式第二层变量清单与类型标注把所有变量列出来并标注定性/定量、定类/定序这一步的意义在于给自己和读者一张“地图”第三层核心变量逐一描述定性变量频数、占比、众数定量变量均值、中位数、标准差、最小值、最大值、偏度、峰度第四层交叉与分组描述选择与业务问题最相关的分维度进行拆解跨组比较时优先用频率而非频数第五层可视化配合每个核心结论配一张图图能独立表达结论图不要过度装饰坐标轴、单位、图例必须清晰第六层结论与数据口径说明列出2-3个最重要的描述性发现写清楚结论基于哪一层口径是否受离群值或结构变化影响这份清单看起来平实但真的能防止起码七成的低级分析失误。我个人这几年做下来最深的体感是描述性统计看起来“简单”实际上是对业务理解深度的考验。均值、标准差、频数这些人人都能算但能不能判断出“这里该用中位数而不是均值”“这里的占比差异究竟受什么结构影响”靠的全是分析者对数据类型和业务场景的准确把握。先把每一个变量是什么类型这件事刻进肌肉记忆后面所有高级分析都会稳得多。