A/B 测试计算器:样本比例不匹配测试 (SRM)
检查A/B测试中的流量分布是否均匀。在线工具快速准确地诊断SRM。只需输入数字即可获得结果。
检查各组的SRM
组 1
组 2
SRM结果
卡方值
1.2195
P值
p = 0.2695
检查A/B测试中的流量分布是否均匀。在线工具快速准确地诊断SRM。只需输入数字即可获得结果。
卡方值
1.2195
P值
p = 0.2695
使用卡方统计方法计算 A/B 测试中预期与实际流量分布的偏差程度。
可即时检测流量分布是否偏离计划比例,帮助维护测试完整性。
提供状态颜色指示(正常、警告、严重),便于快速评估分布问题的严重性。
Sample Ratio Mismatch(SRM,样本比例不匹配) 是一种统计检验,用于判断 A/B 测试中各实验变体的实际用户分配是否与预期分配比例一致。
如果观察到的用户分配与预期比例存在显著差异,则可能意味着随机分流、事件日志记录、实验配置或数据采集存在问题。应在分析实验结果之前进行 SRM 检验,因为一旦存在 SRM,A/B 测试的结论可能不可靠。
该工具使用 卡方检验(Chi-Square,χ²) 比较预期和实际的分组样本数量,并自动计算 p-value。
计算完成后,将显示以下结果:
指标 | 说明 |
|---|---|
卡方统计量 | 用于评估样本分布的 χ² 检验统计量 |
p-value | 观察到当前偏差由随机因素导致的概率 |
检验状态 | 指示是否检测到 Sample Ratio Mismatch |
计算链接 | 可分享的链接,用于保存本次检验参数 |
输入各实验组的实际用户数量。
指定各实验组的预期分配比例。
如有需要,添加更多实验变体。
运行检验。
查看并分析结果。
例如,如果实验设计的流量分配比例为 50% / 50%,但实际两个组分别获得 1,000 和 1,050 名用户,工具将评估这一偏差是否可以合理地由随机波动解释。
SRM 检验特别适用于以下情况:
在分析任何 A/B 测试结果之前;
部署新的用户分流机制之后;
运行包含多个实验变体的实验时;
怀疑分析事件存在丢失时;
修改事件日志系统之后;
更改随机分流机制之后;
当各实验组样本量出现异常差异时。
在许多公司中,SRM 检验是分析任何实验之前的必需步骤。
最常见的原因包括:
用户随机分配错误;
Feature Flag 配置错误;
实验平台故障;
分析事件丢失;
部分用户被过滤;
用户身份识别错误;
Cookie 或身份认证问题;
流量分配错误;
软件缺陷。
SRM 本身并不能指出问题的根本原因,它只能说明观察到的用户分布与预期分配存在统计学上的差异。
如果检测到 SRM,则应极其谨慎地解读实验结果。
即使不同实验变体之间表现出统计显著性,这种差异也可能是由用户分配问题引起,而不是产品改动本身造成的。
在实际工作中,团队通常会先调查并解决导致 SRM 的问题,然后重新运行实验。
本工具仅验证实验组之间用户分配是否正确。
它不会判断哪个实验变体表现更好,也不会比较转化率或估算效应大小。
此外,SRM 检验也无法确定问题的具体来源,它只能表明观察到的用户分配在统计意义上与预期分配存在差异。
Sample Ratio Mismatch Calculator(SRM 计算器) 可以快速验证实验参与者是否按照预期正确分配到各个实验变体中。它是任何 A/B 测试最重要的前置验证步骤之一,有助于在分析产品指标之前及时发现实验实施中的问题。
为了获得完整的实验分析结果,建议将本工具与其他统计分析工具配合使用。在启动实验之前,可使用 Sample Size Calculator 估算所需样本量。SRM 检验通过后,对于连续型指标,可使用 Two-Sample T-Test 分析实验结果;对于转化率等二元指标,则可使用 Chi-Square Test。
SRM 计算器通过分析测试组之间的流量分布,帮助发现 A/B 测试中的问题。它使用卡方统计方法检测可能影响测试有效性的统计异常。
该工具适用于数据分析师、市场人员和需要确保 A/B 测试完整性的专业人士。它有助于发现流量分布偏离预期比例的情况。
计算器提供清晰的结果解释和状态颜色指示,便于判断何时需要干预以保证测试质量。
当实验各组的实际参与人数与计划分配比例存在显著差异时,就会出现样本比例失配(SRM)。这可能表明随机化、分组、跟踪或数据丢失存在问题,并可能使测试结果失效。
输入每个组的实际参与人数和计划分配比例。计算器使用卡方检验比较观察人数与期望人数,并显示卡方值、p 值和 SRM 状态。
添加至少两个组,输入各组的实际人数和计划比例,并确保计划比例之和为 1,然后计算 SRM。p 值较低表示观察到的分配不太可能仅由随机波动造成。
是的,该计算器不仅适用于经典的 A/B 测试,也适用于多变量实验。它有助于识别多个组之间的分配不平衡。
应在实验开始后以及解释结果之前检查 SRM。在监控过程中,或更改流量分配、定向、跟踪或排除规则之后,也应进行检查。发现显著 SRM 时,应先调查原因,再采信测试结果。
常见原因包括流量分配实施错误(代码中的错误)、重定向问题、Cookie 排除不正确、机器人或搜索引擎爬虫扭曲数据,以及将用户从特定组中排除。
是的,显著的 SRM(由低 p 值表示)强烈表明您的 A/B 测试设置或实施方式存在问题。忽略 SRM 可能导致测试结果无效和错误的业务决策。
解决 SRM 通常涉及深入调查 A/B 测试的实施代码,检查流量分配逻辑,确保正确应用用户排除,并分析流量是否存在异常(例如,机器人流量)。