分类数据检验决策指南

分类数据该用哪种统计检验?

不要先看表格大小或 P 值;先确认研究设计、样本是否独立、变量尺度和真正要回答的问题。

当前产品边界

先按研究设计选检验,再打开对应工具

本页是决策指南,不会伪装成万能计算器。确认设计后,可使用下方对应工具;复杂抽样、聚类、连续结局或重复多时点数据需要能表达完整设计的方法。

打开工作区
01

30 秒决策表

先写下分析单位、每个单位是否只出现一次、变量是名义还是有序分类,以及问题是关联、变化、一致性还是拟合已知分布。相同的 2×2 数字表在不同研究设计下可能需要完全不同的检验。

  • 两个独立分类变量:Pearson 卡方独立性检验;若合格的非加权 2×2 整数频数表较稀疏,考虑 Fisher 精确检验。
  • 同一对象或匹配对象的配对二分类结果:McNemar 检验,不使用普通独立性卡方检验。
  • 两个评定者或方法对同一对象分类,问题是一致性:Cohen's kappa;它与检验边际变化的 McNemar 回答不同问题。
  • 一个分类变量与预先给定的期望比例比较:卡方拟合优度检验,而不是独立性检验。
  • 两个变量都有实质顺序:在总体关联检验之外,报告 gamma、Kendall's tau 或 Somers' d 等方向与强度指标。
02

独立样本:卡方还是 Fisher?

Pearson 卡方独立性检验比较观察频数与独立假设下的期望频数,适用于互斥类别和相互独立的观察。输入应是频数而不是百分比;样本量很大时,很小的差异也可能显著,所以还要报告效应量和样本基数。

Fisher 精确检验不是所有小样本表格的通用替代品。Crosstabs 当前只对合格的非加权 2×2 非负整数频数表提供 Fisher 双侧精确结果;更大的稀疏表需要适合研究设计的精确或固定边际 Monte Carlo 方法。

03

配对变化和一致性不是同一个问题

McNemar 检验用于同一对象前后、或一一匹配对象的二分类结果,重点是两个不一致方向的概率是否相同。把这种配对数据当作独立样本会丢失配对结构,并可能得到错误推断。

Cohen's kappa 衡量两个评定者或方法对同一批对象的分类一致性,并扣除机会一致。McNemar 检验边际分布是否改变,kappa 衡量一致程度;二者不能互相替代,也都不能说明某位评定者就是正确答案。

04

显著性之后还要报告什么

至少报告检验名称、研究设计、未加权样本基数、频数与百分比口径、统计量、自由度(如适用)、精确 P 值、效应量及关键限制。独立列联表可配合 Cramér's V;2×2 表可根据问题报告 phi、优势比或风险比;有序变量应保留类别顺序并说明指标方向。

P < 0.05 不是效果大小、结果为真的概率或因果证据。观察性数据仍可能受到混杂、选择偏差、测量误差和多重比较影响。

05

何时不应使用普通交叉表检验

若结局或预测变量是连续数值,通常需要 t 检验、方差分析、相关或回归等方法。重复超过两个时点、整群或分层抽样、复杂调查权重、生存时间和计数结局也需要能表达依赖结构与抽样设计的模型或软件。

设计权重或 Raking 权重下,普通加权卡方通常只是近似结果;需要总体推断时,应使用能处理分层、整群、重复权重或 Rao–Scott 校正的方法。

常见问题

先确认方法,再解释结果。

两个变量都是分类变量,就一定用卡方检验吗?

不一定。还要判断观察是否独立、是否配对、问题是关联还是一致性,以及期望频数是否支持渐近近似。配对二分类用 McNemar;一致性用 kappa。

小样本都应该使用 Fisher 精确检验吗?

不是。Fisher 的适用性取决于表格、频数和研究设计。本网站只对合格的非加权 2×2 整数频数表计算 Fisher;更大稀疏表不能直接套用同一实现。

McNemar 和 Cohen's kappa 有什么区别?

McNemar 检验配对二分类结果的边际变化;kappa 衡量两个评定者或方法超出机会水平的一致程度。一个关注变化,一个关注一致性。

P 值小于 0.05 能证明因果吗?

不能。P 值只描述数据与特定原假设的相容程度;因果判断还需要研究设计、时间顺序、混杂控制和其他证据。

调查权重数据可以直接使用普通卡方吗?

只有真正的频数权重可直接按普通频数解释。设计或校准权重通常需要设计型方差和 Rao–Scott 等校正;当前工作区的普通加权检验应视为近似。

继续分析

在完整数据上运行同样的分析。

源文件在浏览器本地处理,无需注册。

开始分析