A/B 测试计算器:双样本 T 检验

两组数据之间差异统计测试。用于科学研究和 A/B 测试。

数据输入与t检验计算

样本1

观测数量: 0

样本2

观测数量: 0

设置

如果实验重复多次,置信水平是每个样本的均值落入置信区间的案例百分比。

这也是假设为真时,假设被接受(即未发现差异)的案例百分比。

假设类型: d = 0
d = 14.59SE = 0.971p = < 0.001

t检验计算结果

结论

样本1均值更大

置信区间与差异估计

样本1均值
89.56 ± 1.447
样本2均值
74.97 ± 1.653
均值差异
d = 14.59SE = 0.971
H₀: μ₁ = μ₂ (Two-sided)

保存结果

https://devbox.tools/zh/utils/t-test-calculator/#!89.56/2.02221/10;74.97/2.310868/10@95:0

"双样本 T 检验" 工具功能

比较两个样本的平均值

让您确定两组数据之间是否存在统计学意义上的显著差异。

适用于分析和科学研究

用于市场营销、经济学和医学领域的假设检验。

易于解释结果

计算 t 值和统计值,这帮助您做出明智决策。

使用指南与详细说明

双样本 T 检验的作用

双样本 T 检验计算器(Two-Sample T-Test Calculator) 用于判断两个独立样本之间的差异是否具有统计学显著性,或是否可以由随机波动解释。

该工具可计算 t 统计量(t-statistic)p 值(p-value)置信区间(confidence intervals)效应量(effect size),并对样本分布进行可视化展示,使您无需专业统计软件即可解读实验结果。

适用于分析 A/B 测试、产品分析、市场研究、科学实验以及各种定量数据的比较。

工具计算的指标

计算完成后,将显示以下指标:

指标

说明

样本均值

每个样本的平均值

均值差(d)

两个样本均值之间的差值

标准误(SE)

对均值差估计精度的衡量

p 值(p-value)

观察到当前差异由随机因素产生的概率

置信区间

真实均值差可能落入的范围

分布图

两个样本及其置信区间的可视化比较

如何使用工具

  1. 粘贴第一组样本数据。

  2. 粘贴第二组样本数据。

  3. 选择置信水平(通常为 95%)。

  4. 开始计算。

  5. 查看计算结果及图表。

每个观测值单独占一行输入。两组样本的大小无需相同。

如何解读结果

最重要的指标是 p 值(p-value)。如果 p 值小于所选显著性水平(α),则认为两组之间的差异具有统计学显著性。

结果

解读

p-value < α

差异具有统计学显著性

p-value ≥ α

没有足够证据拒绝原假设

其中,α 表示所选的统计显著性水平,由您选择的置信水平决定。

此外,还应关注:

  • 均值差(d) —— 表示两组之间差异的大小;

  • 标准误(SE) —— 反映均值差估计的精确程度;

  • 置信区间 —— 表示真实均值差最有可能所在的范围。

何时使用双样本 T 检验

该工具适用于比较:

  • 用户平均收入;

  • 平均订单金额;

  • 任务完成时间;

  • 页面加载时间;

  • 用户操作次数;

  • 会话持续时间;

  • 产品实验结果;

  • 两个独立组之间的任何定量指标。

T 检验的适用前提

为了可靠地解释结果,通常应满足以下条件:

  • 两个样本彼此独立;

  • 观测值通过随机抽样获得;

  • 数据为定量数据;

  • 数据分布近似正态,或样本量足够大;

  • 不存在对均值产生显著影响的极端离群值。

当样本量足够大时,即使数据分布与正态分布存在适度偏离,T 检验通常仍具有较好的稳健性。

实践建议

  • 在实验开始前估算所需样本量。

  • 不仅要关注 p 值,还要关注均值差的大小。

  • 重视置信区间,它有助于评估真实效应可能的范围。

  • 对两组样本采用一致的数据预处理规则。

  • 将统计分析结果与业务指标结合进行解读。

统计学显著性并不意味着观察到的差异一定具有实际意义或商业价值。

常见错误

  • 在获得统计显著结果后立即结束实验。

  • 多次重复进行显著性检验而不调整分析方法。

  • 忽略置信区间。

  • 将双样本 T 检验用于配对样本或相关样本。

  • 将 T 检验用于分类数据,而不是使用适合的统计检验方法。

工具限制

结果应始终结合具体研究背景进行解释。

结论可能受到以下因素影响:

  • 样本量不足;

  • 极端离群值;

  • 随机分配机制被破坏;

  • 数据采集错误;

  • 系统性偏差。

统计检验仅估计观察到的差异由随机因素造成的概率,并不能证明因果关系

总结

双样本 T 检验可帮助判断两个独立样本之间的差异是否具有统计学显著性。它是分析 A/B 测试、产品实验和定量研究结果的核心工具之一。

在启动实验之前,建议使用样本量计算器(Sample Size Calculator)估算所需样本量。如果实验可能根据累计证据提前结束,可使用序贯抽样计算器(Sequential Sampling Calculator)。在收集实验结果后,还建议使用Sample Ratio Mismatch(SRM)计算器验证实验各变体之间的用户分配是否正确,以发现可能影响统计结论的随机化问题。

工具说明

alien

双样本 t 检验用于比较两组独立数据的平均值。它有助于确定组间是否存在显著差异或者差异是随机的。

这种方法在统计学中用于评估营销策略的有效性、A/B 测试、临床研究和用户行为分析。它对商业和科学各领域的假设检验特别有用。

我们的工具可以自动计算 T 统计量和 p 值并让您根据统计数据快速分析结果并得出结论。

常见问题 (FAQ)

两样本 t 检验比较两个独立组的平均值,以确定它们是否存在显着差异。在比较两个具有连续数据的组的平均值时使用它。

配对 t 检验比较相关测量(前后、匹配对)。非配对 t 检验比较独立组。根据您的研究设计和数据结构进行选择。

T 检验假设:正态分布(或大样本量)、独立观测和组间方差相等。该工具可以为这些假设提供检验。

对于小样本(通常 n < 30),确保每组数据近似服从正态分布或不存在显著异常值至关重要。随着样本量的增加,中心极限定理会降低偏离正态分布的影响。

查看 p 值、置信区间和效应大小。p 值 <0.05 通常表示存在显着差异。置信区间显示了合理差异的范围。

效应量(例如,Cohen's d 系数)衡量组均值之间差异的程度,而不仅仅是差异是否具有统计显著性。它有助于理解差异的实际重要性。

当您知道总体方差且样本量较大时,使用 Z 检验。当总体方差未知且从样本中估计时,t 检验更合适,尤其是对于小样本。

t 检验中的零假设 (H0) 通常表明两个比较组的平均值之间没有显著差异。t 检验评估是否有足够的证据来拒绝该假设。

评价此工具
4.5(24 位用户评分)