A/B 测试计算器:样本大小
计算统计研究和实验所需的样本量,同时考虑显著性水平和置信区间。
计算样本量
灰色区域的转化率将无法与基线区分。
如果存在最小效应,检测到该效应的概率
如果不存在差异,检测到差异的概率
样本量
1,030
每个变体
计算统计研究和实验所需的样本量,同时考虑显著性水平和置信区间。
灰色区域的转化率将无法与基线区分。
如果存在最小效应,检测到该效应的概率
如果不存在差异,检测到差异的概率
1,030
每个变体
可以计算需要多少数据才能获得具有统计学意义的结果。
有助于减少实验和营销测试中出现错误的几率。
通过消除用于分析的冗余资源简化数据收集流程。
样本量计算器(Sample Size Calculator)用于确定获得统计学可靠结果所需的观测数量。该工具根据基线转化率(Baseline Conversion Rate)、最小可检测效应(MDE)、统计显著性水平和统计功效,计算实验和研究所需的最小样本量。
该工具可帮助您:
计算 A/B 测试所需的样本量;
平衡实验速度与结果准确性;
评估 MDE 对实验持续时间的影响;
考虑显著性水平(α)和统计功效(1−β);
将计算参数保存为可共享链接,以便后续使用。
适用于产品分析师、市场营销人员、CRO 专家、研究人员和数据分析师。
参数 | 说明 |
|---|---|
基线转化率 | 对照组当前的转化率 |
MDE(最小可检测效应) | 希望能够检测到的最小转化率变化 |
置信水平 | 统计置信水平(例如 95%) |
统计功效 | 检测真实效应的概率 |
效应类型 | 转化率的绝对变化或相对变化 |
输入当前的转化率。
选择具有实际业务意义的最小效应。
选择置信水平。
如有需要,调整统计功效。
选择效应类型——绝对变化或相对变化。
查看每个实验变体所需的最小样本量。
计算结果表示每个实验组所需的用户数量(或其他观测单位),而不是整个实验的总样本量。
因素 | 影响 |
|---|---|
MDE 越小 | 需要更多参与者 |
统计功效越高 | 需要更大的样本量 |
置信水平越高 | 所需样本量增加 |
基线转化率越高 | 影响取决于预期效应大小 |
最小可检测效应(Minimum Detectable Effect,MDE)是指对业务具有实际价值的最小变化。
例如:
基线转化率 | MDE | 解释 |
|---|---|---|
5% | +0.5% | 非常小的效应 |
5% | +1% | 产品实验中常用 |
5% | +2% | 可使实验更快完成 |
选择过小的 MDE 会显著增加所需样本量和实验持续时间。
根据业务价值选择 MDE,而不是一味追求检测尽可能小的变化。
不要仅为了减少样本量而降低显著性水平。
对于大多数产品实验,建议使用 80–90% 的统计功效。
应在实验开始之前计算所需样本量,而不是看到初步结果之后。
除非采用专门的序贯分析(Sequential Analysis)方法,否则不要在达到所需样本量之前提前结束实验。
样本量不足会增加得出错误结论的风险,并可能导致实施无效的改动。
未计算所需样本量就开始实验。
为检测极小差异而选择不切实际的过小 MDE。
获得第一个“统计显著”结果后立即结束实验。
在实验进行过程中修改实验参数。
将统计显著性误认为效应具有较高实际价值的证明。
该计算基于以下假设:
观测值彼此独立;
用户被随机分配到各实验变体;
数据采集准确;
不存在系统性测量误差。
如果这些假设不成立,则实验的实际可靠性可能与计算结果存在差异。
样本量估算是准备任何统计实验的第一步。它有助于提前确定所需的数据量,避免实验过早结束或持续时间过长。
确定所需样本量后,建议结合以下工具完成完整的实验分析流程:
卡方检验(χ²)计算器 —— 用于分析分类数据,并在适用时比较转化率。
双样本 T 检验计算器 —— 用于在 A/B 测试结束后评估实验变体之间差异的统计显著性。
如果您还希望验证用户是否已正确分配到各实验变体,请使用 Sample Ratio Mismatch(SRM)计算器。
样本量计算器可帮助您确定需要多少观测值才能获得具有统计学意义的结果。这对于规划实验、研究和营销测试非常重要。
样本应该足够大,结果才会可靠,但也不能过大,以免浪费不必要的资源。我们的工具会考虑数据的置信度、误差幅度和预期变异性。
该工具适用于分析师、研究人员、营销人员以及任何处理统计数据并希望优化研究设计的人员。
样本量取决于所需的置信水平、允许误差、总体大小和预期效应大小 (MDE)。效应越大所需的样本量越小,而效应越小则需要更大的样本量才能检测到。
置信水平(通常为 95%)表示您对结果的信心程度。允许误差是您的估计周围的不确定性范围。更高的置信水平或更小的允许误差需要更大的样本量。
采用保守方法 - 将两组以 50/50 的比例均分。
如果总体有限,请使用有限总体校正并尝试最大化覆盖范围。对于非常小的样本,请使用非参数分析方法并考虑降低统计功效。
如果选择的 MDE 过小,将需要巨大的样本量,这可能不切实际。如果选择的 MDE 过大,则可能会错过微小但重要的效应。最佳 MDE 应反映效应的业务或研究价值。
统计功效是检测到真实效应(如果存在)并避免第二类错误(假阴性)的概率。更高的功效(通常为 80% 或更高)需要更大的样本量,以确保您不会错过重要结果。
总体数据中的变异性(标准差)越大,为了达到相同的精度,所需的样本量就越大。这是因为更大的变异性使得获得总体平均值的准确估计更加困难。
对于比较研究,您需要一个样本量计算器,它考虑最小可检测效应(您认为重要的最小差异)和统计功效,以确保您的实验能够检测到这种差异。