调查方法与加权交叉表

调查加权与 Raking(迭代比例拟合)

从权重含义、目标边际和有效样本量开始,生成可复核的加权交叉表,同时避免把普通加权检验误称为复杂抽样推断。

当前产品边界

在工作区应用已准备好的权重

当前工作区不会生成 Raking 权重。请先在专业调查加权工具中创建并验证权重,再把有限且大于零的数值列导入 Crosstabs。

应用已准备好的权重
01

先确认权重代表什么

设计权重通常反映样本单位被抽中的概率差异;校准或 Raking 权重在起始权重上迭代调整,使指定样本边际与外部总体目标对齐;频数权重表示一条记录代表若干条完全相同的记录。三者都能改变加权计数,但不能自动使用同一种方差或显著性计算。

权重不会创造新的受访者,也不能修复目标类别完全没有样本的覆盖缺口。分析前应记录抽样设计、目标来源与日期、类别映射、缺失值规则、收敛容差和权重修剪规则。

02

加权单元格、百分比与有效样本量

加权单元格 = Σ wᵢI(rowᵢ = r, columnᵢ = c);加权列百分比 = 加权单元格 ÷ 同列权重总和。权重离散诊断可写为 n_eff = (Σwᵢ)² ÷ Σwᵢ²,但它不是完整的设计型有效样本量,也不能替代分层、整群或重复权重方差估计。

例如 A 组两人的 Yes 与 No 权重分别为 2 和 1,则加权 Yes 为 2 ÷ 3 = 66.7%,而未加权 Yes 为 1 ÷ 2 = 50%。报告 66.7% 时仍应显示未加权 n = 2,不能把加权基数 3 称为访问人数。

03

可复核的 Raking 与交叉表流程

先检查每个正目标类别都有观察样本,再在当前工作区之外执行 Raking。确认算法收敛,检查最小值、最大值、权重分布和任何修剪造成的目标偏差,然后把验证后的正数权重保存为数值列。

导入后选择该列作为权重,对比加权与未加权输出,并记录被排除的零、负数、缺失或非数值权重。发布时同时说明加权方法、目标、修剪规则、加权估计、未加权样本基数和正确的不确定性方法。

  • 保存目标来源、目标日期、变量和类别映射。
  • 检查收敛误差与极端权重,不用极端权重掩盖空单元格。
  • 并排复核加权与未加权百分比及基数。
  • 明确区分描述性结果、近似检验和设计型推断。
04

复杂抽样推断的边界

Crosstabs 当前按所选权重计算描述性计数和百分比,但不实现分层、整群、有限总体修正、重复权重方差或 Rao–Scott 校正。除权重是真正的重复频数外,显示的加权卡方、P 值、残差、效应量与列比例字母都带有近似性质。

加权 2×2 表不会显示 Fisher 精确检验,因为该检验要求非加权整数频数。需要发表或高风险决策时,应在能表达完整抽样设计的专业软件中完成设计型标准误和检验。

常见问题

先确认方法,再解释结果。

加权交叉表应显示加权基数还是未加权基数?

两者都应保留。加权计数或百分比用于表达估计,未加权样本基数用于说明实际受访人数并支持数据质量诊断。

Raking 和迭代比例拟合是什么?

它反复按每个目标类别的目标总量与当前加权总量之比调整个案权重,循环处理所有目标变量,直到边际误差达到容差或迭代上限。

Crosstabs 会生成 Raking 权重吗?

不会。当前工作区只应用已经准备并验证的正数数值权重列;请先在调查加权软件或研究流程中创建权重。

加权数据可以直接做卡方检验和显著性字母吗?

只有真正的频数权重能直接按普通频数检验解释。设计或校准权重下的普通检验是近似结果;复杂抽样应使用能处理分层、整群、重复权重或 Rao–Scott 校正的方法。

继续分析

在完整数据上运行同样的分析。

源文件在浏览器本地处理,无需注册。

开始分析