ab-test-analysis
phuryn/pm-skills
Analysieren Sie A/B-Testergebnisse unter Berücksichtigung der statistischen Signifikanz, der Validierung der Stichprobengröße, der Konfidenzintervalle sowie von Empfehlungen zum Starten, Erweitern oder Stoppen.
...Alle erweiternA/B-Test-Analyse
Bewerten Sie A/B-Testergebnisse mit statistischer Strenge und übersetzen Sie die Erkenntnisse in klare Produktentscheidungen.
Kontext
Sie analysieren A/B-Testergebnisse für $ARGUMENTS.
Wenn der Benutzer Datendateien (CSV, Excel oder Analytics-Exporte) bereitstellt, lesen und analysieren Sie diese direkt. Erzeugen Sie bei Bedarf Python-Skripte für statistische Berechnungen.
Anweisungen
Verstehen Sie das Experiment:
- Was war die Hypothese?
- Was wurde geändert (die Variante)?
- Was ist die primäre Metrik? Gibt es Schutzmetriken (Guardrail Metrics)?
- Wie lange lief der Test?
- Wie ist der Traffic-Split?
Validieren Sie die Testkonfiguration:
- Stichprobengröße: Ist die Stichprobe groß genug für die erwartete Effektstärke?
- Verwenden Sie die Formel: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Markieren Sie, wenn der Test unterpowert ist (
- Dauer: Lief der Test mindestens 1-2 vollständige Geschäftszyklen lang?
- Randomisierung: Gibt es Hinweise auf eine Sample Ratio Mismatch (SRM)?
- Novelty-/Primacy-Effekte: War genug Zeit vorhanden, um anfängliche Verhaltensänderungen auszuwaschen?
- Stichprobengröße: Ist die Stichprobe groß genug für die erwartete Effektstärke?
Berechnen Sie die statistische Signifikanz:
- Konversionsrate für Kontrolle und Variante
- Relative Steigerung: (Variante - Kontrolle) / Kontrolle × 100
- p-Wert: Unter Verwendung eines zweiseitigen Z-Tests oder Chi-Quadrat-Tests
- Konfidenzintervall: 95-%-KI für die Differenz
- Statistische Signifikanz: Ist p
- Praktische Signifikanz: Ist die Steigerung für das Geschäft relevant?
Wenn der Benutzer Rohdaten bereitstellt, generieren und führen Sie ein Python-Skript aus, um diese zu berechnen.
Überprüfen Sie die Schutzmetriken (Guardrail Metrics):
- Haben sich irgendwelche Schutzmetriken (Umsatz, Interaktion, Seitenladezeit) verschlechtert?
- Ein Gewinn bei der primären Metrik bei gleichzeitig verschlechterten Schutzmetriken ist möglicherweise kein echter Gewinn.
Interpretieren Sie die Ergebnisse:
Ergebnis Empfehlung Signifikante positive Steigerung, keine Probleme bei Schutzmetriken **Veröffentlichen** — auf 100 % ausrollen Signifikante positive Steigerung, Bedenken bei Schutzmetriken **Untersuchen** — Abwägungen verstehen, bevor veröffentlicht wird Nicht signifikant, positiver Trend **Test verlängern** — mehr Daten oder größere Effektstärke erforderlich Nicht signifikant, flach **Test stoppen** — kein bedeutender Unterschied festgestellt Signifikante negative Steigerung **Nicht veröffentlichen** — zur Kontrolle zurückkehren, analysieren, warum Bereitstellen der Analysezusammenfassung:
## A/B-Testergebnisse: [Testname] **Hypothese**: [Was wir erwartet haben] **Dauer**: [X Tage] | **Stichprobe**: [N Kontrolle / M Variante] | Metrik | Kontrolle | Variante | Steigerung | p-Wert | Signifikant? | |---|---|---|---|---|---| | [Primär] | X% | Y% | +Z% | 0.0X | Ja/Nein | | [Schutzmetrik] | ... | ... | ... | ... | ... | **Empfehlung**: [Veröffentlichen / Verlängern / Stoppen / Untersuchen] **Begründung**: [Warum] **Nächste Schritte**: [Was zu tun ist]
Gehen Sie Schritt für Schritt vor. Speichern Sie als Markdown. Generieren Sie Python-Skripte für Berechnungen, wenn Rohdaten bereitgestellt werden.
Weiterführende Literatur
- A/B-Testing 101 + Beispiele
- Testen von Produktideen: Die ultimative Validierungs-Experimentbibliothek
- Verfolgen Sie die richtigen Metriken?
---
name: ab-test-analysis
description: Analyze A/B test results with statistical significance, sample size validation, confidence intervals, and ship/extend/stop recommendations.
---
## A/B Test Analysis
Evaluate A/B test results with statistical rigor and translate findings into clear product decisions.
### Context
You are analyzing A/B test results for **$ARGUMENTS**.
If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.
### Instructions
1. **Understand the experiment**:
- What was the hypothesis?
- What was changed (the variant)?
- What is the primary metric? Any guardrail metrics?
- How long did the test run?
- What is the traffic split?
2. **Validate the test setup**:
- **Sample size**: Is the sample large enough for the expected effect size?
- Use the formula: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
- Flag if the test is underpowered (<80% power)
- **Duration**: Did the test run for at least 1-2 full business cycles?
- **Randomization**: Any evidence of sample ratio mismatch (SRM)?
- **Novelty/primacy effects**: Was there enough time to wash out initial behavior changes?
3. **Calculate statistical significance**:
- **Conversion rate** for control and variant
- **Relative lift**: (variant - control) / control × 100
- **p-value**: Using a two-tailed z-test or chi-squared test
- **Confidence interval**: 95% CI for the difference
- **Statistical significance**: Is p < 0.05?
- **Practical significance**: Is the lift meaningful for the business?
If the user provides raw data, generate and run a Python script to calculate these.
4. **Check guardrail metrics**:
- Did any guardrail metrics (revenue, engagement, page load time) degrade?
- A winning primary metric with degraded guardrails may not be a true win
5. **Interpret results**:
| Outcome | Recommendation |
|---|---|
| Significant positive lift, no guardrail issues | **Ship it** — roll out to 100% |
| Significant positive lift, guardrail concerns | **Investigate** — understand trade-offs before shipping |
| Not significant, positive trend | **Extend the test** — need more data or larger effect |
| Not significant, flat | **Stop the test** — no meaningful difference detected |
| Significant negative lift | **Don't ship** — revert to control, analyze why |
6. **Provide the analysis summary**:
```
## A/B Test Results: [Test Name]
**Hypothesis**: [What we expected]
**Duration**: [X days] | **Sample**: [N control / M variant]
| Metric | Control | Variant | Lift | p-value | Significant? |
|---|---|---|---|---|---|
| [Primary] | X% | Y% | +Z% | 0.0X | Yes/No |
| [Guardrail] | ... | ... | ... | ... | ... |
**Recommendation**: [Ship / Extend / Stop / Investigate]
**Reasoning**: [Why]
**Next steps**: [What to do]
```
Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.
---
### Further Reading
- [A/B Testing 101 + Examples](https://www.productcompass.pm/p/ab-testing-101-for-pms)
- [Testing Product Ideas: The Ultimate Validation Experiments Library](https://www.productcompass.pm/p/the-ultimate-experiments-library)
- [Are You Tracking the Right Metrics?](https://www.productcompass.pm/p/are-you-tracking-the-right-metrics)
Alle Dateien
1 Dateienab-test-analysis installieren
Laden Sie die Skill-Dateien herunter und extrahieren Sie diese in Ihr .claude/skills/-Verzeichnis.
ZIP herunterladenKlonen Sie das Repository und kopieren Sie die Skill-Dateien in Ihr Projekt.
git clone https://github.com/phuryn/pm-skills/tree/main/pm-data-analytics/skills/ab-test-analysis # Copy SKILL.md to your .claude/skills/ directory
Kopieren





Heim
