Back to skills
SKILL.md
Ab Test Designer
ASecurity当你要规划、设计或落地一次 A/B 测试,或搭建持续的增长实验体系时使用;产出含假设、主/次/护栏指标、样本量与运行计划的可执行实验方案,并用 ICE 排期、统计显著性判定结果;不适用于纯埋点实施、单页 CRO 改稿或无对照组的分析。触发词:A/B 测试、ab test、split test、分流测试、多变量测试、MVT、实验设计、假设检验、统计显著性、样本量、ICE 评分、增长实验、experiment backlog、哪个版本更好。
- 3 stars
- 0 votes
- 0 copies
- 0 views
- Added September 19, 2026
Works with
Security analysis
100/100npx -y skills add findscripter/everything-skills --skill ab-test-designer --agent claude-codeAre you the author of Ab Test Designer?
Add the live security badge to your README. It updates with every re-scan.
[](https://www.skillsdirectory.com/skills/findscripter-ab-test-designer)---
name: ab-test-designer
title: A/B 实验设计师
description: 当你要规划、设计或落地一次 A/B 测试,或搭建持续的增长实验体系时使用;产出含假设、主/次/护栏指标、样本量与运行计划的可执行实验方案,并用 ICE 排期、统计显著性判定结果;不适用于纯埋点实施、单页 CRO 改稿或无对照组的分析。触发词:A/B 测试、ab test、split test、分流测试、多变量测试、MVT、实验设计、假设检验、统计显著性、样本量、ICE 评分、增长实验、experiment backlog、哪个版本更好。
domain: 商业/growth
triggers: [A/B 测试, ab test, split test, 分流测试, 多变量测试, MVT, 实验设计, 假设检验, 统计显著性, 样本量, ICE 评分, 增长实验, experiment backlog, 哪个版本更好]
tags: [ab-testing, experimentation, growth, statistics, conversion, ice-scoring, hypothesis]
level: 进阶
status: stable
agents: [claude-code, codex, cursor, gemini-cli]
tools: [PostHog, Optimizely, VWO, LaunchDarkly, Split, Evan Miller sample-size calculator]
requires: []
related: [ab-test-setup-gates, conversion-rate-optimizer, marketing-analytics-tracker, analytics-tracking-setup]
combines_with: [conversion-rate-optimizer, landing-page-copywriting, ab-test-setup-gates]
license: MIT
source: coreyhaines31/marketingskills
source_license: MIT
---
## 何时使用
当用户要对比两个(或多个)方案、用数据判断谁更优,或要搭建系统化的增长实验流程时使用。典型场景:设计 A/B / A/B/n / 多变量(MVT)/ Split URL 测试,写实验假设,算样本量与运行时长,定主指标/次指标/护栏指标,用 ICE 给实验排期,按统计显著性判读结果并沉淀实验手册。
**不该用的边界(负边界):**
- 只是要做埋点/事件追踪的实施 → 用专门的 analytics 类技能。
- 只针对单个落地页做转化文案与版式优化、且不设对照组 → 走 CRO 流程。
- 没有对照组、样本极小或无法分流的「看一眼数据」需求 → 这不是 A/B 测试,别强行套显著性结论。
开始前先确认三件事:① 测试背景(想改进什么、要改什么);② 现状(基线转化率、当前流量);③ 约束(技术复杂度、时间、可用工具)。若仓库存在 `.agents/product-marketing.md`(或 `.claude/product-marketing.md`、旧版 `product-marketing-context.md`),先读它,已覆盖的信息不必再问。
## 步骤
1. **写假设**:一次只测一个变量,给出有依据的明确预测,而非「试试看」。
2. **选测试类型**:按可用流量选 A/B(中等流量)、A/B/n(更高)、MVT(极高)、Split URL(中等)。
3. **定指标**:1 个主指标(与业务价值和假设直接挂钩,用它来判定)、若干次指标(解释为什么生效)、护栏指标(不能变差,恶化就停)。
4. **算样本量**:先定最小可检测提升(MDE),再用计算器算每组样本量与时长,**事先确定、运行中不改**。
5. **设计变体**:单一且足够大的改动,忠于假设。
6. **分配流量**:默认 50/50;高风险用 90/10、80/20 或逐步放量;保证回访用户看到同一变体、曝光在时段上均衡。
7. **选实现方式**:客户端(JS 改页面,快但有闪烁,PostHog/Optimizely/VWO)或服务端(渲染前定变体,无闪烁但需开发,PostHog/LaunchDarkly/Split)。
8. **上线前过 checklist**,运行中只监控不偷看,达到样本量后再判读。
9. **判读结果**:按显著性、效应量、次指标一致性、护栏、分群差异得出结论并归档。
10. **(增长体系)** 把赢家沉淀进实验手册,从学习中产出新假设,循环往复。
## 指令
**假设结构:**
```
因为 [观察/数据],
我们相信 [改动]
会带来 [预期结果]
对于 [受众]。
当 [指标] 变化时,我们就能验证这一点。
```
弱:「改按钮颜色也许能提高点击。」
强:「因为用户反馈很难找到 CTA(热图+反馈佐证),我们相信把按钮放大并用对比色,能让新访客的 CTA 点击率提升 15%+。用从页面浏览到注册开始的点击率衡量。」
**样本量速查(每组所需样本,按基线×相对提升):**
| 基线 | +10% | +20% | +50% |
|------|------|------|------|
| 1% | 150k | 39k | 6k |
| 3% | 47k | 12k | 2k |
| 5% | 27k | 7k | 1.2k |
| 10% | 12k | 3k | 550 |
计算器:Evan Miller `https://www.evanmiller.org/ab-testing/sample-size.html`、Optimizely `https://www.optimizely.com/sample-size-calculator/`。
**上线前 checklist:** 假设已记录 / 主指标已定 / 样本量已算 / 变体实现正确 / 埋点已验证 / 各变体已 QA。
**运行中要做:** 监控技术问题、检查分群质量、记录外部因素。
**运行中禁止:** 偷看结果并提前停(peeking 会制造假阳性)、改动变体、引入新流量来源。
**判读 checklist:** ① 达到样本量了吗(没到=初步结论)② 是否显著(看置信区间)③ 效应量是否有意义(对比 MDE,估算业务影响)④ 次指标是否一致 ⑤ 护栏是否有恶化 ⑥ 分群是否有差异(移动 vs 桌面、新 vs 老)。
**结论对照:** 显著胜出→上线变体;显著落败→保留对照并复盘原因;无显著差异→加流量或做更大胆的测试;信号混杂→下钻分群。
**ICE 排期:** 对每个假设在 Impact(若生效能推动主指标多少)、Confidence(基于数据而非直觉的把握度)、Ease(多快多省地上线并衡量)三项打 1–10 分,ICE = (Impact + Confidence + Ease) / 3,先跑高分实验,每月按上下文重评。
**实验节奏:** 每周(30 分)查技术问题与护栏,护栏显著恶化才停,但不提前判赢;双周收尾已完成实验、更新手册、从 backlog 启动下一个;每月(1 小时)复盘实验速度/胜率/累计提升,补充假设、重排 ICE;每季审计手册(哪些模式已推广、哪些赢家未规模化、漏斗哪段测试不足)。健康指标:每月上线 4–8 个、胜率 20–30%、单测 2–4 周、backlog 储备 20+。
## 示例
**定价页测试:**
- 主指标:套餐选择率
- 次指标:页面停留、套餐分布
- 护栏:客服工单数、退款率
**实验手册条目模板(赢家沉淀):**
```
## [实验名]
日期:[date]
假设:[假设]
样本量:[每组 n]
结果:[胜/负/不确定] — [主指标] 变化 [X%](95% CI:[区间],p=[值])
护栏:[护栏指标及结果]
分群差异:[设备/分群/同期群上的显著差异]
为何生效/失败:[分析]
可复用模式:[如「定价 CTA 旁加社会证明能提升套餐选择」]
可应用于:[其他可能奏效的页面/流程]
状态:[已实施 / 暂缓 / 需跟进测试]
```
## 注意事项
- **设计陷阱**:改动太小(检测不出)、一次测太多(无法归因)、没有清晰假设。
- **执行陷阱**:提前停、中途改变体、不核对实现是否正确。
- **分析陷阱**:忽略置信区间、挑数据(cherry-pick 分群)、过度解读不显著的结果。
- 95% 置信 = p < 0.05,意味着结果纯随机的概率 < 5%,这只是阈值不是保证。
- 「偷看就停」是最常见的致命错误:事先承诺样本量并相信流程。
- 每个测试都要归档:假设、变体(含截图)、结果(样本/指标/显著性)、决策与学习。
## 互见
- **seo-content-writer**:用于生成变体文案与内容版本,作为实验输入。
- **first-principles-thinking**:在假设生成与原因复盘时拆解第一性问题。
---
本条采编自 coreyhaines31/marketingskills(MIT)。
Attribution
Comments
Loading comments…