卡方检验回答什么问题?
独立性检验的原假设是两个分类变量彼此独立。对第 i 行、第 j 列,期望频数为 E = 行合计 × 列合计 ÷ 总样本量;Pearson 统计量为 χ² = Σ(O − E)² ÷ E,自由度为 (r − 1)(c − 1)。工具会显示观察频数、期望频数、Pearson χ²、自由度和 P 值。
常用阈值 p < 0.05 只是一条决策规则。样本很大时,微小差异也可能显著;因此应同时报告 Cramér's V,并检查哪些单元格推动了总体结果。
使用前需要检查的条件
输入必须是互斥类别的观察频数,每位样本在同一张表中通常只计入一次。独立样本设计与配对前后设计不同;同一对象前后两次或一一匹配的配对 2×2 数据应使用 McNemar 检验。百分比没有提供检验所需的样本基数,不能替代观察频数。
普通 Pearson 结果也不等于复杂抽样推断。设计权重、分层或整群抽样通常需要设计型方差与 Rao–Scott 等校正;当前浏览器计算器不会从一张加权频数表重建这些抽样设计。
- 每个观察应相互独立。
- 类别应互斥且定义清楚。
- 不能把百分比当作观察频数。
- 检查期望频数:过多小于 5 的单元格会削弱渐近近似。
完整计算示例:2×2 品牌选择表
假设 A 组有 30 人选择品牌 X、20 人选择品牌 Y;B 组有 20 人选择 X、30 人选择 Y。四格观察频数为 [[30, 20], [20, 30]],总样本 N = 100。两行合计和两列合计都是 50,因此独立性原假设下四格期望频数都为 50 × 50 ÷ 100 = 25。
四格各自贡献 (30 − 25)² ÷ 25 或 (20 − 25)² ÷ 25,也就是 1;合计 χ² = 4.00,自由度 df = (2 − 1)(2 − 1) = 1。由渐近卡方分布得到 χ²(1, N = 100) = 4.00,P = .0455;Cramér's V = √[4 ÷ (100 × 1)] = .20。
在预先设定 α = .05 的单次总体检验中,这提供反对独立性的证据;V = .20 描述关联强度。它没有证明组别导致品牌选择,也不能替代对抽样、随机化、缺失值和测量质量的说明。
先处理期望频数警告,再选择 P 值
Pearson P 值依赖渐近近似。NIST 所述 Cochran 经验规则认为:若最小期望频数小于 1,或超过 20% 的期望频数小于 5,近似可能较差。一个观察频数很小并不自动触发该规则;应检查根据边际合计计算的期望频数。
对于合格的非加权 2×2 非负整数频数表,计算器会在有界工作量内提供双侧 Fisher–Irwin 精确结果。更大的稀疏 r×c 表、配对表、分层表或加权表不能直接套用这一结果;应选择与完整研究设计一致的精确、Monte Carlo 或设计型方法。
哪些单元格推动了总体结果?
Pearson 残差 (O − E) ÷ √E 显示每格对 χ² 的贡献;调整标准化残差还考虑相应行列边际。正值表示观察频数高于独立性假设下的期望,负值表示低于期望。残差是定位总体关联来源的诊断量,不会把总体检验自动变成经过校正的逐格显著性结论。
若把许多单元格、列对、分组、问题或表格分别解释为显著,需要预先定义检验族并处理多重比较。当前计算器报告总体 Pearson 检验、效应量与单元格诊断,不会声称一组未经校正的残差就是完整的多重比较程序。
如何规范报告
写明检验名称、研究设计、样本量、观察频数或百分比口径、χ²、自由度、P 值、Cramér's V、期望频数诊断和预先设定的 α。例如:Pearson χ²(2, N = 240) = 9.84,P = .007,Cramér's V = .20。若改用 Fisher、Monte Carlo、连续性校正、设计型检验或多重比较校正,也应明确说明。