dummy-dataset
phuryn/pm-skills
Générez des ensembles de données factices réalistes à des fins de test, avec des colonnes, des contraintes et des formats de sortie personnalisables (CSV, JSON, SQL, script Python).
...Développer toutGénération d'ensembles de données factices
Générez des ensembles de données factices réalistes pour vos tests, avec des colonnes, des contraintes et des formats de sortie personnalisables (CSV, JSON, SQL, script Python). Créez des scripts exécutables ou des fichiers de données prêts à l'emploi.
À utiliser pour : créer des données de test, générer des ensembles de données d'exemple, créer des données factices réalistes pour le développement ou alimenter des environnements de test.
Arguments :
$PRODUCT: Nom du produit ou du système$DATASET_TYPE: Type de données (par exemple, avis clients, transactions, profils utilisateur)$ROWS: Nombre de lignes à générer (par défaut : 100)$COLUMNS: Colonnes ou champs spécifiques à inclure$FORMAT: Format de sortie (CSV, JSON, SQL, script Python)$CONSTRAINTS: Contraintes ou règles métier supplémentaires
Processus étape par étape
- Identifier le type de jeu de données - Comprendre le domaine des données
- Définir les spécifications des colonnes : noms, types de données et plages de valeurs
- Déterminer le nombre de lignes – Combien d’enregistrements d’échantillon sont nécessaires
- Sélectionner le format de sortie : CSV, JSON, SQL INSERT ou script Python
- Appliquer des modèles réalistes - S'assurer que les données semblent authentiques et valides
- Ajouter des contraintes métier - Respecter la logique métier et les relations
- Générer ou créer un script de données - Créer une sortie exécutable
- Valider la sortie - S'assurer de la qualité et de l'exhaustivité des données
Modèle : sortie sous forme de script Python
import csv
import json
from datetime import datetime, timedelta
import random
# Configuration
ROWS = $ROWS
FILENAME = "$DATASET_TYPE.csv"
# Column definitions with realistic value generators
columns = {
"id": "auto-increment",
"name": "first_last_name",
"email": "email",
"created_at": "timestamp",
# Add more columns...
}
def generate_dataset():
"""Generate realistic dummy dataset"""
data = []
for i in range(1, ROWS + 1):
record = {
"id": f"U{i:06d}",
# Generate values based on column definitions
}
data.append(record)
return data
def save_as_csv(data, filename):
"""Save dataset as CSV"""
with open(filename, 'w', newline='') as f:
writer = csv.DictWriter(f, fieldnames=data[0].keys())
writer.writeheader()
writer.writerows(data)
if __name__ == "__main__":
dataset = generate_dataset()
save_as_csv(dataset, FILENAME)
print(f"Generated {len(dataset)} records in {FILENAME}")
Exemple de spécification d’ensemble de données
Type d’ensemble de données : Avis clients
Colonnes :
- feedback_id (numérotation automatique, U001, U002...)
- customer_name (noms réalistes)
- email (format d'adresse e-mail valide)
- feedback_date (dates des 90 derniers jours)
- rating (1 à 5 étoiles)
- category (Bug, Demande de fonctionnalité, Réclamation, Félicitations)
- text (commentaire réaliste)
- produit (électronique, vêtements, maison)
Contraintes :
- Répartition des notes : 40 % de 5 étoiles, 30 % de 4 étoiles, 20 % de 3 étoiles, 10 % de 1 à 2 étoiles
- Catégorie « Bug » uniquement avec des notes comprises entre 1 et 3
- Demandes de fonctionnalités uniquement avec des notes comprises entre 3 et 5
- Domaines d'e-mail réalistes (gmail, yahoo, entreprise.com)
Livrables
- Script Python prêt à l'exécution OU fichier de données direct
- Fichier CSV avec en-têtes et mise en forme corrects
- Fichier JSON avec une structure et des types valides
- Instructions SQL INSERT pour le remplissage de la base de données
- Validation des données et respect des contraintes
- Valeurs réalistes et adaptées au contexte métier
- Documentation de la logique de génération des données
- Instructions de démarrage rapide pour l'utilisation du jeu de données
Formats de sortie
CSV : format tabulaire plat, facile à importer dans des tableurs et des bases de données
JSON : structure imbriquée, idéale pour les API et les bases de données NoSQL
SQL : instructions INSERT, directement exécutables sur des bases de données relationnelles
Script Python : générateur exécutable pour des ensembles de données personnalisés ou volumineux
---
name: dummy-dataset
description: Generate realistic dummy datasets for testing with customizable columns, constraints, and output formats (CSV, JSON, SQL, Python script).
---
# Dummy Dataset Generation
Generate realistic dummy datasets for testing with customizable columns, constraints, and output formats (CSV, JSON, SQL, Python script). Creates executable scripts or direct data files for immediate use.
**Use when:** Creating test data, generating sample datasets, building realistic mock data for development, or populating test environments.
**Arguments:**
- `$PRODUCT`: The product or system name
- `$DATASET_TYPE`: Type of data (e.g., customer feedback, transactions, user profiles)
- `$ROWS`: Number of rows to generate (default: 100)
- `$COLUMNS`: Specific columns or fields to include
- `$FORMAT`: Output format (CSV, JSON, SQL, Python script)
- `$CONSTRAINTS`: Additional constraints or business rules
## Step-by-Step Process
1. **Identify dataset type** - Understand the data domain
2. **Define column specifications** - Names, data types, and value ranges
3. **Determine row count** - How many sample records needed
4. **Select output format** - CSV, JSON, SQL INSERT, or Python script
5. **Apply realistic patterns** - Ensure data looks authentic and valid
6. **Add business constraints** - Respect business logic and relationships
7. **Generate or script data** - Create executable output
8. **Validate output** - Ensure data quality and completeness
## Template: Python Script Output
```python
import csv
import json
from datetime import datetime, timedelta
import random
# Configuration
ROWS = $ROWS
FILENAME = "$DATASET_TYPE.csv"
# Column definitions with realistic value generators
columns = {
"id": "auto-increment",
"name": "first_last_name",
"email": "email",
"created_at": "timestamp",
# Add more columns...
}
def generate_dataset():
"""Generate realistic dummy dataset"""
data = []
for i in range(1, ROWS + 1):
record = {
"id": f"U{i:06d}",
# Generate values based on column definitions
}
data.append(record)
return data
def save_as_csv(data, filename):
"""Save dataset as CSV"""
with open(filename, 'w', newline='') as f:
writer = csv.DictWriter(f, fieldnames=data[0].keys())
writer.writeheader()
writer.writerows(data)
if __name__ == "__main__":
dataset = generate_dataset()
save_as_csv(dataset, FILENAME)
print(f"Generated {len(dataset)} records in {FILENAME}")
```
## Example Dataset Specification
**Dataset Type:** Customer Feedback
**Columns:**
- feedback_id (auto-increment, U001, U002...)
- customer_name (realistic names)
- email (valid email format)
- feedback_date (dates last 90 days)
- rating (1-5 stars)
- category (Bug, Feature Request, Complaint, Praise)
- text (realistic feedback)
- product (electronics, clothing, home)
**Constraints:**
- Ratings skewed: 40% 5-star, 30% 4-star, 20% 3-star, 10% 1-2 star
- Bug category only with ratings 1-3
- Feature requests only with ratings 3-5
- Email domains realistic (gmail, yahoo, company.com)
## Output Deliverables
- Ready-to-execute Python script OR direct data file
- CSV file with proper headers and formatting
- JSON file with valid structure and types
- SQL INSERT statements for database population
- Data validation and constraint compliance
- Realistic, business-appropriate values
- Documentation of data generation logic
- Quick-start instructions for using the dataset
## Output Formats
**CSV:** Flat tabular format, easy to import into spreadsheets and databases
**JSON:** Nested structure, ideal for APIs and NoSQL databases
**SQL:** INSERT statements, directly executable on relational databases
**Python Script:** Executable generator for custom or large datasets
Tous les fichiers
1 fichiersInstaller dummy-dataset
Téléchargez et décompressez les fichiers de compétences dans votre répertoire .claude/skills/.
Télécharger le ZIPClonez le dépôt et copiez les fichiers de compétence dans votre projet.
git clone https://github.com/phuryn/pm-skills/tree/main/pm-execution/skills/dummy-dataset # Copy SKILL.md to your .claude/skills/ directory
Copier





Maison
