A/B 测试显著性计算器
对你的 A/B 测试结果进行双比例 z-test。输入对照组和变体组的访客数和转化数,即可获得转化率、z-score、p-value、统计显著性、相对提升和置信区间。
输入
对照组 (A)
变体组 (B)
测试设置
输出
| 指标 | 值 |
|---|---|
| No data yet | |
使用指南
这个计算器是做什么的?
输入对照组 (A) 和变体组 (B) 的访客数和转化数,本工具将运行双比例 z-test — 这是比较两个转化率的标准统计检验。它会报告每组的转化率、绝对和相对差异、z-score 和 p-value、差异和相对提升的置信区间,以及用通俗语言说明结果是否具有统计显著性。
底层的一切都是双比例 z-test:合并转化率和标准误用于计算 z-score 和 p-value(假设检验),而未合并的标准误用于置信区间 — 这是标准惯例,因为置信区间不应像零假设那样假设两个比率相等。
如何使用
- 输入对照组 (A) 和变体组 (B) 的访客数和转化数。
- 选择置信水平 — 90%、95%(常用默认值)或 99%。
- 如果只想知道 B 是否在任一方向上与 A 不同,选择双尾检验;如果想专门知道 B 是否优于 A,选择单尾检验。
- 阅读结果表:结论行用通俗语言告诉你是否可以相信这个差异,下方的行显示支撑该结论的数据。
这里的"统计显著"是什么意思?
它意味着 p-value 低于你选择的显著性阈值(1 − 置信水平,例如 95% 置信水平下为 0.05) — 换句话说,如果 A 和 B 之间真的没有差异,这么大的差距不太可能仅凭偶然出现。这不能保证 B 在长期中确实更好,也不说明改善的幅度有多大 — 始终将提升幅度及其置信区间与 p-value 一起阅读。
我需要多少样本量?
没有固定的数字 — 这取决于你的基准转化率和你试图检测的效果大小。一般来说,合计样本低于约 1,000 名访客时,除非提升非常大,否则很少能检测到任何差异;较小的真实差异需要按比例更大的样本。如果计算器显示"数据不足",请继续运行测试,而不是过早停止 — 反复查看结果并在看到显著性时立即停止会膨胀你的假阳性率。
单尾检验 vs. 双尾检验 — 我应该选哪个?
默认使用双尾检验:它测试 B 是否在任一方向上与 A 不同,是更安全的选择,因为变体总是可能表现不佳。只有在查看数据之前就决定了方向性假设时才使用单尾检验(例如"B 只可能更好,不可能更差")— 单尾检验需要更少的证据就能达到显著性,因此在看到数据后切换到单尾检验是欺骗自己的常见方式。
为什么置信区间和 p-value 同样重要?
p-value 只告诉你差异是否可能真实存在;它不说明差异的大小。相对提升的置信区间显示了真实效果的合理范围 — 一个"显著"的结果,如果 CI 为 +2% 到 +54%,远不如 CI 为 +22% 到 +34% 的结果具有可操作性,即使两者都达到了相同的 p-value 标准。
隐私
所有计算都在你的浏览器中本地运行 — 你的数据永远不会被发送到服务器。
Use it from code
From 3 credits per callREST API
curl -X POST https://api.iotools.cloud/v1/tool/ab-test-significance-calculator \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"controlVisitors": "5000",
"controlConversions": "250",
"variantVisitors": "5000",
"variantConversions": "320",
"confidenceLevel": "95",
"tailType": "two"
}'Swap in your own key from your account. The tool's fields are the body — no wrapper.
Ask an AI agent
Use the IOTools `ab-test-significance-calculator` tool (A/B Test Significance Calculator) on this input:
YOUR_INPUT_HEREPaste this at any agent connected to the IOTools MCP server, then add your input.