分类数据显著性检验

卡方检验计算器

用观察频数检验两个分类变量是否独立,并同时报告关联强度和适用性警告。

在线计算 Pearson 卡方检验

输入 2×2 至 8×8 的观察频数;请勿输入百分比。

表格大小提示:可直接从 Excel 或表格软件粘贴一块频数。
已有数据文件?打开完整分析工作区 →此计算器适合快速检验;工作区支持文件导入、筛选、加权、导出和本地保存。
合计
50
50
合计5050100

Pearson 卡方(χ²)

4.00

df = 1 · p = .046 · Cramér's V = 0.20

χ²(1, N = 100) = 4.00, p = .046, V = .20

全部统计结果
Pearson 卡方检验χ² = 4.000, df = 1, p = .046
G 检验(似然比)G = 4.027, df = 1, p = .045
卡方检验(Yates 连续性校正)χ² = 3.240, p = .072
Fisher 精确检验(双侧)p = .071
优势比0.444 (95% CI 0.200 – 0.989)
Cramér's V0.200 (小)
Phi 系数(φ)-0.200
列联系数(C)0.196
Lambda(对称 / 行依赖 / 列依赖)0.200 / 0.200 / 0.200
Goodman–Kruskal gamma (γ)-0.385
Kendall's tau-b / tau-c-0.200 / -0.200
Somers' d-0.200 / -0.200 / -0.200
Theil's U0.029 / 0.029 / 0.029
01

卡方检验回答什么问题?

独立性检验的原假设是两个分类变量彼此独立。对第 i 行、第 j 列,期望频数为 E = 行合计 × 列合计 ÷ 总样本量;Pearson 统计量为 χ² = Σ(O − E)² ÷ E,自由度为 (r − 1)(c − 1)。工具会显示观察频数、期望频数、Pearson χ²、自由度和 P 值。

常用阈值 p < 0.05 只是一条决策规则。样本很大时,微小差异也可能显著;因此应同时报告 Cramér's V,并检查哪些单元格推动了总体结果。

02

使用前需要检查的条件

输入必须是互斥类别的观察频数,每位样本在同一张表中通常只计入一次。独立样本设计与配对前后设计不同;同一对象前后两次或一一匹配的配对 2×2 数据应使用 McNemar 检验。百分比没有提供检验所需的样本基数,不能替代观察频数。

普通 Pearson 结果也不等于复杂抽样推断。设计权重、分层或整群抽样通常需要设计型方差与 Rao–Scott 等校正;当前浏览器计算器不会从一张加权频数表重建这些抽样设计。

  • 每个观察应相互独立。
  • 类别应互斥且定义清楚。
  • 不能把百分比当作观察频数。
  • 检查期望频数:过多小于 5 的单元格会削弱渐近近似。
03

完整计算示例:2×2 品牌选择表

假设 A 组有 30 人选择品牌 X、20 人选择品牌 Y;B 组有 20 人选择 X、30 人选择 Y。四格观察频数为 [[30, 20], [20, 30]],总样本 N = 100。两行合计和两列合计都是 50,因此独立性原假设下四格期望频数都为 50 × 50 ÷ 100 = 25。

四格各自贡献 (30 − 25)² ÷ 25 或 (20 − 25)² ÷ 25,也就是 1;合计 χ² = 4.00,自由度 df = (2 − 1)(2 − 1) = 1。由渐近卡方分布得到 χ²(1, N = 100) = 4.00,P = .0455;Cramér's V = √[4 ÷ (100 × 1)] = .20。

在预先设定 α = .05 的单次总体检验中,这提供反对独立性的证据;V = .20 描述关联强度。它没有证明组别导致品牌选择,也不能替代对抽样、随机化、缺失值和测量质量的说明。

04

先处理期望频数警告,再选择 P 值

Pearson P 值依赖渐近近似。NIST 所述 Cochran 经验规则认为:若最小期望频数小于 1,或超过 20% 的期望频数小于 5,近似可能较差。一个观察频数很小并不自动触发该规则;应检查根据边际合计计算的期望频数。

对于合格的非加权 2×2 非负整数频数表,计算器会在有界工作量内提供双侧 Fisher–Irwin 精确结果。更大的稀疏 r×c 表、配对表、分层表或加权表不能直接套用这一结果;应选择与完整研究设计一致的精确、Monte Carlo 或设计型方法。

05

哪些单元格推动了总体结果?

Pearson 残差 (O − E) ÷ √E 显示每格对 χ² 的贡献;调整标准化残差还考虑相应行列边际。正值表示观察频数高于独立性假设下的期望,负值表示低于期望。残差是定位总体关联来源的诊断量,不会把总体检验自动变成经过校正的逐格显著性结论。

若把许多单元格、列对、分组、问题或表格分别解释为显著,需要预先定义检验族并处理多重比较。当前计算器报告总体 Pearson 检验、效应量与单元格诊断,不会声称一组未经校正的残差就是完整的多重比较程序。

06

如何规范报告

写明检验名称、研究设计、样本量、观察频数或百分比口径、χ²、自由度、P 值、Cramér's V、期望频数诊断和预先设定的 α。例如:Pearson χ²(2, N = 240) = 9.84,P = .007,Cramér's V = .20。若改用 Fisher、Monte Carlo、连续性校正、设计型检验或多重比较校正,也应明确说明。

常见问题

先确认方法,再解释结果。

P 值小于 0.05 代表什么?

在原假设成立时,得到当前或更极端分布的概率较小,因此通常拒绝独立性假设。它不等于结果为真的概率。

卡方检验显著是否代表关联很强?

不代表。显著性受样本量影响,关联强度应结合 Cramér's V、百分比差异和实际场景判断。

2×2 表什么时候使用 Fisher 精确检验?

当样本较小或期望频数不足时,Fisher 精确检验通常比渐近卡方更可靠。计算器会在可计算时同时给出结果。

继续分析

在完整数据上运行同样的分析。

源文件在浏览器本地处理,无需注册。

开始分析