先读列字母,再读单元格字母
假设 Banner 列依次标为 A、B、C。A 列某个单元格显示“42% B”,意思是 A 列的 42% 显著高于 B 列同一行的比例。它不表示 A 显著高于整张表,也不表示 B 与其他行或其他变量存在差异。
如果显示小写“42% b”,该差异只达到较宽松的 90% 阈值;大写字母使用较严格的 95% 阈值。没有字母只表示在当前阈值、校正、列基数和可检验范围内没有发现合格差异,不能证明两列完全相同。
- 列头字母标识被比较的 Banner 列。
- 单元格字母只列出该单元格所在列显著高于的列。
- 大写字母代表较严格阈值,小写字母代表较宽松阈值。
- 方向来自百分比大小;P 值本身不表示差异幅度。
检验比较的是同一行中的两个列比例
Crosstabs 对每个结果行的每一对合格 Banner 列运行双侧、合并方差的双比例 z 检验。检验使用单元格计数、对应列合计和合并比例计算标准误,再把字母放在比例较高的一侧。Banner 列应代表相互独立的样本组;同一对象的前后配对结果需要 McNemar 等配对方法。
列字母不能替代整张表的 Pearson 卡方检验。卡方检验回答两个分类变量的总体分布是否有关联;列比例字母定位同一结果行中的具体列对差异。解释时可先看总体检验与 Cramér's V,再查看哪些列对推动了可解释的差异。
Bonferroni 校正限制偶然阳性
五个合格 Banner 列产生 5×4÷2 = 10 个列对。若每一对都直接使用 0.05 阈值,至少出现一个偶然阳性的整体风险会升高。Crosstabs 在每个结果行内把严格阈值和宽松阈值分别除以合格列对数,再判断大写或小写字母。
这个校正范围只覆盖当前结果行内的 Banner 列对,不会自动跨所有行、所有问题、所有表格或分析者尝试的筛选切分控制完整检验族。如果多个结果共同支持同一决策,应在分析计划中明确更完整的多重比较范围。
样本基数、加权和复杂抽样决定可解释边界
当前工作区排除检验列基数低于 30 的列,并在普通交叉表超过 12 个 Banner 列或 250 个行类别时停止生成字母。30 是产品的保守运行阈值,不是所有场景都可靠的充分条件;比例接近 0 或 1、有效样本量低或列间不独立时,正态近似仍可能较差。
加权分析把加权计数和加权列合计传给普通双比例检验,因此只有真正的频数权重可以按普通频数推断解释。设计权重或校准权重下的字母是近似结果;报告时保留未加权样本基数。分层、整群、有限总体修正或重复权重需要能表达完整抽样设计的方法。
让字母成为可复核证据,而不是装饰
交付表应同时显示列字母键、列百分比、未加权样本基数、严格与宽松阈值、校正方法、低基数排除规则、权重状态和任何容量警告。只复制“显著”结论而不保留分母和比较列,会让读者无法复核方向与适用条件。
显著不等于重要。把字母与绝对百分点差、置信区间或预先约定的实务阈值一起解释;整张表还应报告效应量。发布多个探索性切分时,明确哪些发现是预先设定、哪些需要独立样本确认。
- 记录每列标签及对应字母,不依赖颜色传达含义。
- 保留原始百分比、未加权 n、权重说明和过滤条件。
- 披露 95%/90% 阈值、Bonferroni 范围和被排除的列。
- 用百分点差和效应量说明实务意义,不把显著性解释为因果。