30 秒决策表
先写下分析单位、每个单位是否只出现一次、变量是名义还是有序分类,以及问题是关联、变化、一致性还是拟合已知分布。相同的 2×2 数字表在不同研究设计下可能需要完全不同的检验。
- 两个独立分类变量:Pearson 卡方独立性检验;若合格的非加权 2×2 整数频数表较稀疏,考虑 Fisher 精确检验。
- 同一对象或匹配对象的配对二分类结果:McNemar 检验,不使用普通独立性卡方检验。
- 两个评定者或方法对同一对象分类,问题是一致性:Cohen's kappa;它与检验边际变化的 McNemar 回答不同问题。
- 一个分类变量与预先给定的期望比例比较:卡方拟合优度检验,而不是独立性检验。
- 两个变量都有实质顺序:在总体关联检验之外,报告 gamma、Kendall's tau 或 Somers' d 等方向与强度指标。
独立样本:卡方还是 Fisher?
Pearson 卡方独立性检验比较观察频数与独立假设下的期望频数,适用于互斥类别和相互独立的观察。输入应是频数而不是百分比;样本量很大时,很小的差异也可能显著,所以还要报告效应量和样本基数。
Fisher 精确检验不是所有小样本表格的通用替代品。Crosstabs 当前只对合格的非加权 2×2 非负整数频数表提供 Fisher 双侧精确结果;更大的稀疏表需要适合研究设计的精确或固定边际 Monte Carlo 方法。
配对变化和一致性不是同一个问题
McNemar 检验用于同一对象前后、或一一匹配对象的二分类结果,重点是两个不一致方向的概率是否相同。把这种配对数据当作独立样本会丢失配对结构,并可能得到错误推断。
Cohen's kappa 衡量两个评定者或方法对同一批对象的分类一致性,并扣除机会一致。McNemar 检验边际分布是否改变,kappa 衡量一致程度;二者不能互相替代,也都不能说明某位评定者就是正确答案。
显著性之后还要报告什么
至少报告检验名称、研究设计、未加权样本基数、频数与百分比口径、统计量、自由度(如适用)、精确 P 值、效应量及关键限制。独立列联表可配合 Cramér's V;2×2 表可根据问题报告 phi、优势比或风险比;有序变量应保留类别顺序并说明指标方向。
P < 0.05 不是效果大小、结果为真的概率或因果证据。观察性数据仍可能受到混杂、选择偏差、测量误差和多重比较影响。
何时不应使用普通交叉表检验
若结局或预测变量是连续数值,通常需要 t 检验、方差分析、相关或回归等方法。重复超过两个时点、整群或分层抽样、复杂调查权重、生存时间和计数结局也需要能表达依赖结构与抽样设计的模型或软件。
设计权重或 Raking 权重下,普通加权卡方通常只是近似结果;需要总体推断时,应使用能处理分层、整群、重复权重或 Rao–Scott 校正的方法。