ab-test-analysis
phuryn/pm-skills
Проведите анализ результатов A/B-тестирования с учетом статистической значимости, проверки размера выборки, доверительных интервалов, а также рекомендаций по запуску, продлению или прекращению тестирования.
...Расширить всеАнализ результатов A/B-тестирования
Оценивайте результаты A/B-тестирования с помощью статистических методов и преобразуйте полученные выводы в четкие решения по продукту.
Контекст
Вы анализируете результаты A/B-тестирования для $ARGUMENTS.
Если пользователь предоставит файлы с данными (CSV, Excel или экспортированные данные из аналитики), считывайте и анализируйте их напрямую. При необходимости создавайте скрипты на Python для выполнения статистических вычислений.
Инструкции
Поймите суть эксперимента:
- Какова была гипотеза?
- Что было изменено (вариант)?
- Каков основной показатель? Есть ли контрольные показатели?
- Как долго длилось тестирование?
- Каково распределение трафика?
Проверьте настройки теста:
- Размер выборки: достаточно ли велика выборка для ожидаемого размера эффекта?
- Используйте формулу: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Пометьте, если тест имеет недостаточную мощность (<80% мощности)
- Продолжительность: проводился ли тест в течение как минимум 1–2 полных бизнес-циклов?
- Рандомизация: имеются ли признаки несоответствия соотношений в выборках (SRM)?
- Эффекты новизны/первичности: было ли достаточно времени для устранения первоначальных изменений в поведении?
- Размер выборки: достаточно ли велика выборка для ожидаемого размера эффекта?
Рассчитайте статистическую значимость:
- Коэффициент конверсии для контрольной группы и варианта
- Относительный рост: (вариант — контроль) / контроль × 100
- p-значение: с использованием двустороннего z-критерия или критерия хи-квадрат
- Доверительный интервал: 95% ДИ для разницы
- Статистическая значимость: p < 0,05?
- Практическая значимость: является ли рост конверсии значимым для бизнеса?
Если пользователь предоставляет необработанные данные, сгенерируйте и запустите скрипт на Python для расчёта этих показателей.
Проверьте контрольные показатели:
- Ухудшились ли какие-либо контрольные показатели (выручка, вовлеченность, время загрузки страницы)?
- Успех по основному показателю при ухудшении контрольных показателей может не быть настоящим успехом
Интерпретация результатов:
Результат Рекомендация Значительный положительный рост, проблем с контрольными показателями нет Запускайте — внедряйте на 100 % Значительный положительный эффект, имеются опасения относительно ограничителей Изучить — оценить компромиссы перед запуском Незначительная положительная тенденция Продлить тестирование — требуется больше данных или более выраженный эффект Незначительный, стабильный Прекратить тест — значимой разницы не обнаружено Значительный отрицательный рост Не запускать — вернуть к контрольной версии, проанализировать причины Предоставьте сводку анализа:
## A/B Test Results: [Test Name] **Hypothesis**: [What we expected] **Duration**: [X days] | **Sample**: [N control / M variant] | Metric | Control | Variant | Lift | p-value | Significant? | |---|---|---|---|---|---| | [Primary] | X% | Y% | +Z% | 0.0X | Yes/No | | [Guardrail] | ... | ... | ... | ... | ... | **Recommendation**: [Ship / Extend / Stop / Investigate] **Reasoning**: [Why] **Next steps**: [What to do]
Думайте пошагово. Сохраните в формате Markdown. Сгенерируйте скрипты на Python для расчетов, если предоставлены исходные данные.
Дополнительная литература
- A/B-тестирование: введение + примеры
- Тестирование идей продуктов: исчерпывающая библиотека экспериментов по валидации
- Отслеживаете ли вы правильные показатели?
---
name: ab-test-analysis
description: Analyze A/B test results with statistical significance, sample size validation, confidence intervals, and ship/extend/stop recommendations.
---
## A/B Test Analysis
Evaluate A/B test results with statistical rigor and translate findings into clear product decisions.
### Context
You are analyzing A/B test results for **$ARGUMENTS**.
If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.
### Instructions
1. **Understand the experiment**:
- What was the hypothesis?
- What was changed (the variant)?
- What is the primary metric? Any guardrail metrics?
- How long did the test run?
- What is the traffic split?
2. **Validate the test setup**:
- **Sample size**: Is the sample large enough for the expected effect size?
- Use the formula: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Flag if the test is underpowered (<80% power)
- **Duration**: Did the test run for at least 1-2 full business cycles?
- **Randomization**: Any evidence of sample ratio mismatch (SRM)?
- **Novelty/primacy effects**: Was there enough time to wash out initial behavior changes?
3. **Calculate statistical significance**:
- **Conversion rate** for control and variant
- **Relative lift**: (variant - control) / control × 100
- **p-value**: Using a two-tailed z-test or chi-squared test
- **Confidence interval**: 95% CI for the difference
- **Statistical significance**: Is p < 0.05?
- **Practical significance**: Is the lift meaningful for the business?
If the user provides raw data, generate and run a Python script to calculate these.
4. **Check guardrail metrics**:
- Did any guardrail metrics (revenue, engagement, page load time) degrade?
- A winning primary metric with degraded guardrails may not be a true win
5. **Interpret results**:
| Outcome | Recommendation |
|---|---|
| Significant positive lift, no guardrail issues | **Ship it** — roll out to 100% |
| Significant positive lift, guardrail concerns | **Investigate** — understand trade-offs before shipping |
| Not significant, positive trend | **Extend the test** — need more data or larger effect |
| Not significant, flat | **Stop the test** — no meaningful difference detected |
| Significant negative lift | **Don't ship** — revert to control, analyze why |
6. **Provide the analysis summary**:
```
## A/B Test Results: [Test Name]
**Hypothesis**: [What we expected]
**Duration**: [X days] | **Sample**: [N control / M variant]
| Metric | Control | Variant | Lift | p-value | Significant? |
|---|---|---|---|---|---|
| [Primary] | X% | Y% | +Z% | 0.0X | Yes/No |
| [Guardrail] | ... | ... | ... | ... | ... |
**Recommendation**: [Ship / Extend / Stop / Investigate]
**Reasoning**: [Why]
**Next steps**: [What to do]
```
Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.
---
### Further Reading
- [A/B Testing 101 + Examples](https://www.productcompass.pm/p/ab-testing-101-for-pms)
- [Testing Product Ideas: The Ultimate Validation Experiments Library](https://www.productcompass.pm/p/the-ultimate-experiments-library)
- [Are You Tracking the Right Metrics?](https://www.productcompass.pm/p/are-you-tracking-the-right-metrics)
Все файлы
1 файловУстановить ab-test-analysis
Скачайте файлы навыков и распакуйте их в каталог .claude/skills/.
Скачать ZIPКлонируйте репозиторий и скопируйте файлы навыка в свой проект.
git clone https://github.com/phuryn/pm-skills/tree/main/pm-data-analytics/skills/ab-test-analysis # Copy SKILL.md to your .claude/skills/ directory
Копировать





Дом
