什么是特征选择?文本分类中常用的特征选择方法有哪些?

什么是特征选择?文本分类中常用的特征选择方法有哪些?
特征选择与文本分类中的常用方法一、什么是特征选择特征选择Feature Selection是从原始特征集合中选取一个最优子集的过程目标是在不损失或尽量少损失分类性能的前提下降低特征维度减少计算开销和存储需求消除噪声特征去除对分类无贡献甚至有害的特征提升泛化能力缓解维度灾难高维空间中样本更稀疏距离度量区分度下降提升可解释性更少的特征使模型更易理解与特征提取如 PCA不同特征选择不改变原始特征的语义只是筛选子集特征提取则通过变换生成全新特征。文本分类中为什么需要特征选择文本向量化后词表动辄数万到数十万维但其中大量特征是噪声问题特征示例危害极低频词全语料仅出现 1-2 次无法提供统计规律增加过拟合风险极高频通用词“的”、“是”、“在”无类别区分力稀释有效特征权重停用词“因为”、“所以”语法功能词语义信息极少噪声词OCR 错误、乱码纯噪声干扰二、文本分类常用特征选择方法方法分类总览特征选择方法 ├── 过滤法Filter—— 基于统计指标独立评估每个特征与分类器无关 │ ├── 卡方检验Chi-square │ ├── 信息增益Information Gain │ ├── 互信息Mutual Information │ └── 文档频率Document Frequency ├── 包装法Wrapper—— 用分类器性能反馈选择特征子集 │ └── 递归特征消除RFE └── 嵌入法Embedded—— 特征选择内嵌在模型训练中 ├── L1 正则化Lasso └── 基于树的特征重要性文本分类中过滤法最常用因为计算高效且与后续分类器解耦。1. 卡方检验Chi-Square, χ²原理检验特征w ww与类别c cc之间是否统计独立。独立性越低特征对类别的区分力越强。对每个词w ww和类别c cc构建 2×2 列联表属于类别 c不属于类别 c包含词 wAB不含词 wCD计算卡方统计量χ 2 ( w , c ) N ⋅ ( A D − B C ) 2 ( A B ) ( C D ) ( A C ) ( B D ) \chi^2(w, c) \frac{N \cdot (AD - BC)^2}{(AB)(CD)(AC)(BD)}χ2(w,c)(AB)(CD)(AC)(BD)N⋅(AD−BC)2​其中N A B C D N ABCDNABCD为总文档数。选择策略对每个词计算与每个类别的χ 2 \chi^2χ2取最大值作为该词的全局得分按得分降序排列选取 Top-K 个词作为特征子集特点优点缺点计算高效线性复杂度低频词可能产生虚高卡方值需配合 min_df 过滤统计理论严谨只衡量线性相关性无法捕捉非线性关系文本分类中最常用对类别不平衡敏感2. 信息增益Information Gain, IG原理衡量知道特征w ww是否出现后类别不确定性减少的程度。信息增益越大特征越重要。I G ( w ) H ( C ) − H ( C ∣ w ) IG(w) H(C) - H(C|w)IG(w)H(C)−H(C∣w)展开为I G ( w ) − ∑ c P ( c ) log ⁡ P ( c ) P ( w ) ∑ c P ( c ∣ w ) log ⁡ P ( c ∣ w ) P ( w ˉ ) ∑ c P ( c ∣ w ˉ ) log ⁡ P ( c ∣ w ˉ ) IG(w) -\sum_c P(c)\log P(c) P(w)\sum_c P(c|w)\log P(c|w) P(\bar{w})\sum_c P(c|\bar{w})\log P(c|\bar{w})IG(w)−c∑​P(c)logP(c)P(w)c∑​P(c∣w)logP(c∣w)P(wˉ)c∑​P(c∣wˉ)logP(c∣wˉ)其中H ( C ) H(C)H(C)是类别熵先验不确定性H ( C ∣ w ) H(C|w)H(C∣w)是已知特征w ww状态后的条件熵P ( w ) P(w)P(w)/P ( w ˉ ) P(\bar{w})P(wˉ)是词出现/不出现的概率特点优点缺点同时考虑特征出现和不出现的影响计算量略大于卡方理论上更全面对低频词可能过度估计不出现的信息量也计入效果通常与卡方相当或略优需要估计多个概率小样本下不稳定3. 互信息Mutual Information, MI原理衡量特征w ww与类别c cc之间的互信息量M I ( w , c ) log ⁡ P ( w , c ) P ( w ) ⋅ P ( c ) log ⁡ P ( w ∣ c ) P ( w ) MI(w, c) \log \frac{P(w, c)}{P(w) \cdot P(c)} \log \frac{P(w|c)}{P(w)}MI(w,c)logP(w)⋅P(c)P(w,c)​logP(w)P(w∣c)​两种计算方式最大互信息M I m a x ( w ) max ⁡ c M I ( w , c ) MI_{max}(w) \max_c MI(w, c)MImax​(w)maxc​MI(w,c)—— 词对某个类别最强关联平均互信息M I a v g ( w ) ∑ c P ( c ) ⋅ M I ( w , c ) MI_{avg}(w) \sum_c P(c) \cdot MI(w, c)MIavg​(w)∑c​P(c)⋅MI(w,c)—— 词对所有类别的平均关联特点优点缺点信息论基础扎实对低频词有严重偏好——低频词的P ( w ) P(w)P(w)很小导致M I MIMI值虚高适合分析词-类别关联实际分类效果通常不如卡方和信息增益互信息的低频偏好问题使其在文本分类中不如卡方和信息增益常用。4. 文档频率Document Frequency, DF原理最简单的方法——统计包含词w ww的文档数按预设阈值过滤。策略设定min_df如 3去除出现文档数过少的词低频噪声设定max_df如 0.95去除出现文档比例过高的词通用词/停用词特点优点缺点计算极其简单几乎无开销未考虑特征与类别的关联只看频率效果出人意料地好去噪即可大幅提升无法识别中频但无区分力的词通常作为其他方法的前置过滤独立使用时特征选择精度最低实践建议DF 几乎总是作为第一步使用先用 DF 粗筛去除极端频率词再用卡方/信息增益精筛。5. L1 正则化Lasso—— 嵌入法原理在分类器目标函数中加入 L1 范数惩罚min ⁡ w 1 n ∑ i L ( f ( x i ; w ) , y i ) λ ∥ w ∥ 1 \min_w \frac{1}{n}\sum_i L(f(x_i; w), y_i) \lambda \|w\|_1wmin​n1​i∑​L(f(xi​;w),yi​)λ∥w∥1​L1 正则化使大量特征的权重被压缩为精确零天然实现特征选择。特点优点缺点特征选择与分类器训练同步完成需训练完整模型计算成本高于过滤法选择的特征与分类器目标一致正则强度λ \lambdaλ需调参产生稀疏解天然降维特征间高度相关时可能随机保留其一6. 递归特征消除RFE—— 包装法原理反复训练分类器每次移除权重最小的特征直到达到目标特征数。1. 用全部特征训练分类器如线性 SVM 2. 按特征权重绝对值排序 3. 移除权重最小的 r 个特征 4. 用剩余特征重新训练 5. 重复 2-4 直到达到目标维度特点优点缺点选择的特征与分类器性能直接挂钩计算成本最高多次训练精度通常最优不适合超大规模特征空间文本分类中特征维度极高RFE 通常不作为首选仅在特征数已大幅缩减后精调使用。三、方法对比与选择建议综合对比方法类型计算成本效果适用场景文档频率 DF过滤极低基线去噪必做的前置过滤卡方检验 χ²过滤低优秀首选通用性最好信息增益 IG过滤低优秀与卡方相当理论更全面互信息 MI过滤低一般分析词-类别关联不推荐做主选择器L1 正则化嵌入中优秀与线性分类器配合使用RFE包装高最优特征数已缩减后的精调实践推荐流程原始词表数万~数十万维 │ ▼ ① DF 过滤min_df3~5, max_df0.9~0.95 │ 去除极端频率词维度降至数千~数万 ▼ ② 卡方检验 / 信息增益 Top-K 选择 │ K 通常取 1000~20000通过交叉验证确定 ▼ ③ TF-IDF 向量化仅用选出的特征子集 │ ▼ ④ 分类器训练SVM / 朴素贝叶斯 / 逻辑回归 │ 可选L1 正则化进一步稀疏化 ▼ ⑤ 交叉验证评估调整 K 值关键经验值参数经验范围说明min_df3~5去除语料中出现少于该次数的词max_df0.90~0.95去除出现在超过该比例文档中的词Top-K1000~20000通过交叉验证在验证集上选最优 K特征保留比例原始词表的 1%~10%通常能保持 95% 的分类性能四、总结特征选择是文本分类中降低维度、去噪提效的关键步骤。文本分类中最常用的方法是过滤法其中卡方检验和信息增益是效果最稳健的两种文档频率作为前置去噪几乎必用。选择策略上遵循先 DF 粗筛去极端频率词再卡方/信息增益精筛 Top-K最后用分类器交叉验证定 K的实践流程能在大幅降维的同时保持甚至提升分类性能。