A/B 测试计算器:卡方检验
使用卡方检验法检验两类分类数据之间差异的统计意义。
数据输入与卡方检验(χ²)计算
样本1
样本2
卡方检验(χ²)计算结果
结论
样本2 更成功
P-value
p = 0.035
变体 A 和 B 的预期分布
置信水平表示如果您多次重复研究,置信区间包含真实总体参数的案例百分比。
更高的置信水平意味着更宽的置信区间。
使用卡方检验法检验两类分类数据之间差异的统计意义。
样本2 更成功
P-value
p = 0.035
置信水平表示如果您多次重复研究,置信区间包含真实总体参数的案例百分比。
更高的置信水平意味着更宽的置信区间。
用于分析研究和实验中分类变量之间的关系。
有助于评估变化对用户行为和活动效果的影响。
让您避免复杂的手工计算并简化大量数据的分析。
卡方检验(χ²)计算器可帮助判断两个组在分类变量上的差异是否具有统计学显著性,还是仅仅由随机因素造成。
该工具专为分析独立样本中的成功与失败次数而设计,可自动计算 p-value(p 值),帮助您快速评估 A/B 测试、营销活动以及其他使用二元指标的实验结果。
适用于产品分析、市场营销、UX 研究、科学实验和转化率分析。
对于每个样本,请输入以下信息:
参数 | 说明 |
|---|---|
成功次数 | 成功结果的数量(例如:转化次数) |
总试验次数 | 观察总次数 |
置信水平 | 检验所使用的统计显著性水平 |
工具将根据这些输入数据计算两个样本之间差异的统计显著性。
计算完成后,将显示以下结果:
指标 | 说明 |
|---|---|
表现更好的样本 | 观察到成功率更高的组 |
p 值(p-value) | 观察到当前差异由随机因素产生的概率 |
分布图 | 两个样本结果的可视化对比 |
计算链接 | 可共享的链接,可保留当前分析参数 |
最重要的指标是 p 值(p-value)。
结果 | 解释 |
|---|---|
p-value < α | 差异具有统计学显著性 |
p-value ≥ α | 没有足够证据证明差异具有统计学显著性 |
其中,α 表示所选择的显著性水平。
请注意,统计学显著性并不代表效应的大小或实际业务意义。它仅表示观察到的差异由随机因素产生的可能性有多低。
该工具特别适用于分析:
网站转化率;
广告活动点击率(CTR);
电子邮件打开率;
用户注册数;
完成购买数;
转化漏斗完成率;
使用二元指标的 A/B 测试结果;
任何属于“成功 / 失败”类型的数据。
χ² 检验适用于分类数据。如果您需要比较连续变量的平均值(例如平均订单金额、网站停留时间或会话时长),则更适合使用 双样本 T 检验(Two-Sample T-Test)。
卡方检验回答的问题是:各组成功结果的比例是否存在差异? T 检验回答的问题是:各组连续型指标的平均值是否存在差异?
使用 χ² 检验比较连续数值型指标。
将检验应用于相关(非独立)样本。
样本量过小,导致统计功效不足。
多次连续进行显著性检验,却未调整分析方法。
将统计学显著性误认为某项改动具有较大的实际影响。
测试结果应始终结合具体研究背景进行解释。
以下因素可能影响结论的可靠性:
样本量较小;
用户未被随机分配;
数据收集错误;
系统性偏差(Bias);
观测值之间存在依赖关系。
该检验仅估计观察到的差异由随机因素产生的概率,并不能解释这些差异产生的原因。
卡方检验能够快速评估两个独立组之间成功率差异是否具有统计学显著性。它特别适用于分析 A/B 测试中的转化、点击、注册以及其他二元指标。
为了获得更全面的实验分析结果,建议结合其他统计工具一起使用。在启动实验之前,可使用 样本量计算器(Sample Size Calculator)估算所需样本量。如果实验分析的是连续型指标而不是分类结果,应使用双样本 T 检验而不是 χ² 检验。在进行 A/B 测试时,还建议使用 Sample Ratio Mismatch(SRM)计算器检查各实验变体之间的用户分配是否正确。
在统计学中卡方检验用于检验两个分类变量之间关系的假设。该工具有助于分析变量之间的关系并确定显著差异。
卡方检验可用于确定观察到的差异是随机的还是表明具有统计意义的模式。它广泛应用于营销研究、A/B 测试、用户行为分析和医学统计。
我们的工具会自动计算卡方值并显示显著性水平。这为需要快速进行统计分析的研究人员、分析师和数据科学家提供便利。
卡方检验确定分类变量之间是否存在显着关联。使用它来检验变量之间的独立性或评估观察频率和期望频率之间的一致性。
该计算器使用每个样本中的成功次数和用户总数数据。基于这些值,它自动生成一个 2x2 表格(方案 A / 方案 B × 成功 / 失败),并计算 χ² 统计量。
p 值小于 0.05(通常)表示变量之间存在显着关联。该工具提供卡方统计量、自由度和 p 值以供解释。
卡方检验要求:独立观察、分类数据、足够的样本量和从总体中随机抽样。
对于非常小的数据集,不建议使用此检验。在这种情况下,最好使用费舍尔精确检验。
是的。该计算器适用于分析转化率、点击率、注册量、购买量以及其他比较两组用户数据的二元指标。
拟合优度检验用于检验单个分类变量的观察频率是否符合预期分布。独立性检验用于确定两个分类变量之间是否存在关联。
样本量越大,结果越可靠。如果样本量太小,测试可能无法检测到任何真正的差异。为了得出可靠的结论,每个组最好至少有几十个转化案例。