ab-test-analysis
phuryn/pm-skills
Analice los resultados de las pruebas A/B con significación estadística, validación del tamaño de la muestra, intervalos de confianza y recomendaciones para implementar/ampliar o detener.
...Expandir todoAnálisis de pruebas A/B
Evalúa los resultados de las pruebas A/B con rigor estadístico y traduce los hallazgos en decisiones claras de producto.
Contexto
Estás analizando los resultados de una prueba A/B para $ARGUMENTS.
Si el usuario proporciona archivos de datos (CSV, Excel o exportaciones de análisis), léelos y analízalos directamente. Genera scripts de Python para los cálculos estadísticos cuando sea necesario.
Instrucciones
Comprende el experimento:
- ¿Cuál era la hipótesis?
- ¿Qué se cambió (la variante)?
- ¿Cuál es la métrica principal? ¿Hay métricas de seguridad?
- ¿Cuánto tiempo duró la prueba?
- ¿Cuál es la distribución del tráfico?
Valida la configuración de la prueba:
- Tamaño de la muestra: ¿Es la muestra lo suficientemente grande para el tamaño del efecto esperado?
- Utiliza la fórmula: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Indica si la prueba tiene baja potencia (
- Duración: ¿La prueba duró al menos 1-2 ciclos comerciales completos?
- Aleatorización: ¿Hay evidencia de una discrepancia en la proporción de la muestra (SRM)?
- Efectos de novedad/principio: ¿Hubo tiempo suficiente para eliminar los cambios iniciales en el comportamiento?
- Tamaño de la muestra: ¿Es la muestra lo suficientemente grande para el tamaño del efecto esperado?
Calcula la significación estadística:
- Tasa de conversión para el control y la variante
- Mejora relativa: (variante - control) / control × 100
- Valor p: Mediante una prueba z de dos colas o una prueba chi-cuadrada
- Intervalo de confianza: IC del 95% para la diferencia
- Significación estadística: ¿Es p
- Significación práctica: ¿Es la mejora significativa para el negocio?
Si el usuario proporciona datos sin procesar, genera y ejecuta un script de Python para calcular estos valores.
Verifica las métricas de seguridad:
- ¿Se degradó alguna métrica de seguridad (ingresos, participación, tiempo de carga de la página)?
- Una mejora significativa en la métrica principal con métricas de seguridad degradadas puede no ser una victoria real
Interpreta los resultados:
Resultado Recomendación Mejora significativa positiva, sin problemas de seguridad **Implementarlo** — lanzar al 100% Mejora significativa positiva, preocupaciones de seguridad **Investigar** — comprender los compromisos antes de implementar No significativo, tendencia positiva **Prolongar la prueba** — se necesitan más datos o un efecto mayor No significativo, plano **Detener la prueba** — no se detectó una diferencia significativa Mejora significativa negativa **No implementarlo** — revertir al control, analizar por qué Proporciona el resumen del análisis:
## Resultados de la prueba A/B: [Nombre de la prueba] **Hipótesis**: [Lo que esperábamos] **Duración**: [X días] | **Muestra**: [N control / M variante] | Métrica | Control | Variante | Mejora | Valor p | ¿Significativo? | |---|---|---|---|---|---| | [Principal] | X% | Y% | +Z% | 0.0X | Sí/No | | [Seguridad] | ... | ... | ... | ... | ... | **Recomendación**: [Implementar / Prolongar / Detener / Investigar] **Razonamiento**: [Por qué] **Próximos pasos**: [Qué hacer]
Piensa paso a paso. Guarda como markdown. Genera scripts de Python para los cálculos si se proporcionan datos sin procesar.
Lectura adicional
- Pruebas A/B 101 + Ejemplos
- Prueba de ideas de producto: La biblioteca definitiva de experimentos de validación
- ¿Estás rastreando las métricas correctas?
---
name: ab-test-analysis
description: Analyze A/B test results with statistical significance, sample size validation, confidence intervals, and ship/extend/stop recommendations.
---
## A/B Test Analysis
Evaluate A/B test results with statistical rigor and translate findings into clear product decisions.
### Context
You are analyzing A/B test results for **$ARGUMENTS**.
If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.
### Instructions
1. **Understand the experiment**:
- What was the hypothesis?
- What was changed (the variant)?
- What is the primary metric? Any guardrail metrics?
- How long did the test run?
- What is the traffic split?
2. **Validate the test setup**:
- **Sample size**: Is the sample large enough for the expected effect size?
- Use the formula: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Flag if the test is underpowered (<80% power)
- **Duration**: Did the test run for at least 1-2 full business cycles?
- **Randomization**: Any evidence of sample ratio mismatch (SRM)?
- **Novelty/primacy effects**: Was there enough time to wash out initial behavior changes?
3. **Calculate statistical significance**:
- **Conversion rate** for control and variant
- **Relative lift**: (variant - control) / control × 100
- **p-value**: Using a two-tailed z-test or chi-squared test
- **Confidence interval**: 95% CI for the difference
- **Statistical significance**: Is p < 0.05?
- **Practical significance**: Is the lift meaningful for the business?
If the user provides raw data, generate and run a Python script to calculate these.
4. **Check guardrail metrics**:
- Did any guardrail metrics (revenue, engagement, page load time) degrade?
- A winning primary metric with degraded guardrails may not be a true win
5. **Interpret results**:
| Outcome | Recommendation |
|---|---|
| Significant positive lift, no guardrail issues | **Ship it** — roll out to 100% |
| Significant positive lift, guardrail concerns | **Investigate** — understand trade-offs before shipping |
| Not significant, positive trend | **Extend the test** — need more data or larger effect |
| Not significant, flat | **Stop the test** — no meaningful difference detected |
| Significant negative lift | **Don't ship** — revert to control, analyze why |
6. **Provide the analysis summary**:
```
## A/B Test Results: [Test Name]
**Hypothesis**: [What we expected]
**Duration**: [X days] | **Sample**: [N control / M variant]
| Metric | Control | Variant | Lift | p-value | Significant? |
|---|---|---|---|---|---|
| [Primary] | X% | Y% | +Z% | 0.0X | Yes/No |
| [Guardrail] | ... | ... | ... | ... | ... |
**Recommendation**: [Ship / Extend / Stop / Investigate]
**Reasoning**: [Why]
**Next steps**: [What to do]
```
Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.
---
### Further Reading
- [A/B Testing 101 + Examples](https://www.productcompass.pm/p/ab-testing-101-for-pms)
- [Testing Product Ideas: The Ultimate Validation Experiments Library](https://www.productcompass.pm/p/the-ultimate-experiments-library)
- [Are You Tracking the Right Metrics?](https://www.productcompass.pm/p/are-you-tracking-the-right-metrics)
Todos los archivos
1 archivosInstalar ab-test-analysis
Descarga y extrae los archivos de habilidades en tu directorio .claude/skills/.
Descargar ZIPClona el repositorio y copia los archivos de la habilidad a tu proyecto.
git clone https://github.com/phuryn/pm-skills/tree/main/pm-data-analytics/skills/ab-test-analysis # Copy SKILL.md to your .claude/skills/ directory
Copiar





Hogar
