opción

dummy-dataset

phuryn/pm-skills phuryn/pm-skills

Genera conjuntos de datos ficticios realistas para realizar pruebas, con columnas, restricciones y formatos de salida personalizables (CSV, JSON, SQL, script de Python).

...Expandir todo
0
Tiempo actualizado 29 de septiembre de 2026

Generación de conjuntos de datos ficticios

Genera conjuntos de datos ficticios realistas para realizar pruebas con columnas, restricciones y formatos de salida personalizables (CSV, JSON, SQL, script de Python). Crea scripts ejecutables o archivos de datos directos para su uso inmediato.

Cuándo utilizarlo: Para crear datos de prueba, generar conjuntos de datos de muestra, crear datos ficticios realistas para el desarrollo o rellenar entornos de prueba.

Argumentos:

  • $PRODUCT: El nombre del producto o del sistema
  • $DATASET_TYPE: Tipo de datos (p. ej., comentarios de clientes, transacciones, perfiles de usuario)
  • $ROWS: Número de filas que se van a generar (por defecto: 100)
  • $COLUMNS: Columnas o campos específicos que se deben incluir
  • $FORMAT: Formato de salida (CSV, JSON, SQL, script de Python)
  • $CONSTRAINTS: Restricciones o reglas de negocio adicionales

Proceso paso a paso

  1. Identificar el tipo de conjunto de datos: comprender el ámbito de los datos
  2. Definir las especificaciones de las columnas: nombres, tipos de datos y rangos de valores
  3. Determinar el número de filas: cuántos registros de muestra se necesitan
  4. Seleccionar el formato de salida: CSV, JSON, SQL INSERT o script de Python
  5. Aplicar patrones realistas: asegurarse de que los datos parezcan auténticos y válidos
  6. Añadir restricciones de negocio: respetar la lógica de negocio y las relaciones
  7. Generar o crear un script con los datos: crear una salida ejecutable
  8. Validar el resultado: garantizar la calidad y la integridad de los datos

Plantilla: Salida de script de Python

import csv
import json
from datetime import datetime, timedelta
import random

# Configuration
ROWS = $ROWS
FILENAME = "$DATASET_TYPE.csv"

# Column definitions with realistic value generators
columns = {
    "id": "auto-increment",
    "name": "first_last_name",
    "email": "email",
    "created_at": "timestamp",
    # Add more columns...
}

def generate_dataset():
    """Generate realistic dummy dataset"""
    data = []
    for i in range(1, ROWS + 1):
        record = {
            "id": f"U{i:06d}",
            # Generate values based on column definitions
        }
        data.append(record)
    return data

def save_as_csv(data, filename):
    """Save dataset as CSV"""
    with open(filename, 'w', newline='') as f:
        writer = csv.DictWriter(f, fieldnames=data[0].keys())
        writer.writeheader()
        writer.writerows(data)

if __name__ == "__main__":
    dataset = generate_dataset()
    save_as_csv(dataset, FILENAME)
    print(f"Generated {len(dataset)} records in {FILENAME}")

Ejemplo de especificación de un conjunto de datos

Tipo de conjunto de datos: Comentarios de los clientes

Columnas:

  • feedback_id (autoincremento, U001, U002...)
  • customer_name (nombres realistas)
  • email (formato de correo electrónico válido)
  • feedback_date (fechas de los últimos 90 días)
  • rating (1-5 estrellas)
  • categoría (error, solicitud de función, queja, elogio)
  • texto (comentarios realistas)
  • producto (electrónica, ropa, hogar)

Restricciones:

  • Valoraciones sesgadas: 40 % de 5 estrellas, 30 % de 4 estrellas, 20 % de 3 estrellas, 10 % de 1-2 estrellas
  • Categoría «Error» solo con valoraciones de 1 a 3
  • Solicitudes de funciones solo con valoraciones de 3 a 5
  • Dominios de correo electrónico realistas (gmail, yahoo, company.com)

Resultados esperados

  • Script de Python listo para ejecutarse O archivo de datos directo
  • Archivo CSV con encabezados y formato adecuados
  • Archivo JSON con estructura y tipos válidos
  • Instrucciones SQL INSERT para el rellenado de la base de datos
  • Validación de datos y cumplimiento de restricciones
  • Valores realistas y adecuados para el contexto empresarial
  • Documentación de la lógica de generación de datos
  • Instrucciones de inicio rápido para el uso del conjunto de datos

Formatos de salida

CSV: formato tabular plano, fácil de importar a hojas de cálculo y bases de datos

JSON: estructura anidada, ideal para API y bases de datos NoSQL

SQL: sentencias INSERT, ejecutables directamente en bases de datos relacionales

Script de Python: generador ejecutable para conjuntos de datos personalizados o de gran tamaño

Ver en GitHub
---
name: dummy-dataset
description: Generate realistic dummy datasets for testing with customizable columns, constraints, and output formats (CSV, JSON, SQL, Python script).
---
# Dummy Dataset Generation

Generate realistic dummy datasets for testing with customizable columns, constraints, and output formats (CSV, JSON, SQL, Python script). Creates executable scripts or direct data files for immediate use.

**Use when:** Creating test data, generating sample datasets, building realistic mock data for development, or populating test environments.

**Arguments:**
- `$PRODUCT`: The product or system name
- `$DATASET_TYPE`: Type of data (e.g., customer feedback, transactions, user profiles)
- `$ROWS`: Number of rows to generate (default: 100)
- `$COLUMNS`: Specific columns or fields to include
- `$FORMAT`: Output format (CSV, JSON, SQL, Python script)
- `$CONSTRAINTS`: Additional constraints or business rules

## Step-by-Step Process

1. **Identify dataset type** - Understand the data domain
2. **Define column specifications** - Names, data types, and value ranges
3. **Determine row count** - How many sample records needed
4. **Select output format** - CSV, JSON, SQL INSERT, or Python script
5. **Apply realistic patterns** - Ensure data looks authentic and valid
6. **Add business constraints** - Respect business logic and relationships
7. **Generate or script data** - Create executable output
8. **Validate output** - Ensure data quality and completeness

## Template: Python Script Output

```python
import csv
import json
from datetime import datetime, timedelta
import random

# Configuration
ROWS = $ROWS
FILENAME = "$DATASET_TYPE.csv"

# Column definitions with realistic value generators
columns = {
    "id": "auto-increment",
    "name": "first_last_name",
    "email": "email",
    "created_at": "timestamp",
    # Add more columns...
}

def generate_dataset():
    """Generate realistic dummy dataset"""
    data = []
    for i in range(1, ROWS + 1):
        record = {
            "id": f"U{i:06d}",
            # Generate values based on column definitions
        }
        data.append(record)
    return data

def save_as_csv(data, filename):
    """Save dataset as CSV"""
    with open(filename, 'w', newline='') as f:
        writer = csv.DictWriter(f, fieldnames=data[0].keys())
        writer.writeheader()
        writer.writerows(data)

if __name__ == "__main__":
    dataset = generate_dataset()
    save_as_csv(dataset, FILENAME)
    print(f"Generated {len(dataset)} records in {FILENAME}")
```

## Example Dataset Specification

**Dataset Type:** Customer Feedback

**Columns:**
- feedback_id (auto-increment, U001, U002...)
- customer_name (realistic names)
- email (valid email format)
- feedback_date (dates last 90 days)
- rating (1-5 stars)
- category (Bug, Feature Request, Complaint, Praise)
- text (realistic feedback)
- product (electronics, clothing, home)

**Constraints:**
- Ratings skewed: 40% 5-star, 30% 4-star, 20% 3-star, 10% 1-2 star
- Bug category only with ratings 1-3
- Feature requests only with ratings 3-5
- Email domains realistic (gmail, yahoo, company.com)

## Output Deliverables

- Ready-to-execute Python script OR direct data file
- CSV file with proper headers and formatting
- JSON file with valid structure and types
- SQL INSERT statements for database population
- Data validation and constraint compliance
- Realistic, business-appropriate values
- Documentation of data generation logic
- Quick-start instructions for using the dataset

## Output Formats

**CSV:** Flat tabular format, easy to import into spreadsheets and databases

**JSON:** Nested structure, ideal for APIs and NoSQL databases

**SQL:** INSERT statements, directly executable on relational databases

**Python Script:** Executable generator for custom or large datasets

Todos los archivos

1 archivos

Instalar dummy-dataset

Descarga y descomprime los archivos de habilidades en tu directorio .claude/skills/.

Descargar ZIP

Clona el repositorio y copia los archivos de la habilidad a tu proyecto.

git clone https://github.com/phuryn/pm-skills/tree/main/pm-execution/skills/dummy-dataset # Copy SKILL.md to your .claude/skills/ directory

Copiar Copiar
Configuración rápida: Copia la carpeta de la habilidad en .claude/skills/ Claude detectará y utilizará automáticamente la habilidad
Repositorio phuryn/pm-skills

Habilidades relacionadas

microservices-patterns
Tiempo actualizado 29 de junio de 2026
jpa-patterns
Tiempo actualizado 30 de junio de 2026
fabric-lakehouse
Tiempo actualizado 30 de junio de 2026
prisma-expert
Tiempo actualizado 29 de junio de 2026
OR