先确认权重代表什么
设计权重通常反映样本单位被抽中的概率差异;校准或 Raking 权重在起始权重上迭代调整,使指定样本边际与外部总体目标对齐;频数权重表示一条记录代表若干条完全相同的记录。三者都能改变加权计数,但不能自动使用同一种方差或显著性计算。
权重不会创造新的受访者,也不能修复目标类别完全没有样本的覆盖缺口。分析前应记录抽样设计、目标来源与日期、类别映射、缺失值规则、收敛容差和权重修剪规则。
加权单元格、百分比与有效样本量
加权单元格 = Σ wᵢI(rowᵢ = r, columnᵢ = c);加权列百分比 = 加权单元格 ÷ 同列权重总和。权重离散诊断可写为 n_eff = (Σwᵢ)² ÷ Σwᵢ²,但它不是完整的设计型有效样本量,也不能替代分层、整群或重复权重方差估计。
例如 A 组两人的 Yes 与 No 权重分别为 2 和 1,则加权 Yes 为 2 ÷ 3 = 66.7%,而未加权 Yes 为 1 ÷ 2 = 50%。报告 66.7% 时仍应显示未加权 n = 2,不能把加权基数 3 称为访问人数。
可复核的 Raking 与交叉表流程
先检查每个正目标类别都有观察样本,再在当前工作区之外执行 Raking。确认算法收敛,检查最小值、最大值、权重分布和任何修剪造成的目标偏差,然后把验证后的正数权重保存为数值列。
导入后选择该列作为权重,对比加权与未加权输出,并记录被排除的零、负数、缺失或非数值权重。发布时同时说明加权方法、目标、修剪规则、加权估计、未加权样本基数和正确的不确定性方法。
- 保存目标来源、目标日期、变量和类别映射。
- 检查收敛误差与极端权重,不用极端权重掩盖空单元格。
- 并排复核加权与未加权百分比及基数。
- 明确区分描述性结果、近似检验和设计型推断。
复杂抽样推断的边界
Crosstabs 当前按所选权重计算描述性计数和百分比,但不实现分层、整群、有限总体修正、重复权重方差或 Rao–Scott 校正。除权重是真正的重复频数外,显示的加权卡方、P 值、残差、效应量与列比例字母都带有近似性质。
加权 2×2 表不会显示 Fisher 精确检验,因为该检验要求非加权整数频数。需要发表或高风险决策时,应在能表达完整抽样设计的专业软件中完成设计型标准误和检验。