nemo-automodel-launcher-config
NVIDIA/skills
Configure o início de tarefas do NeMo AutoModel para execuções interativas, clusters Slurm e execução em nuvem com o SkyPilot.
...Expandir tudoConfiguração do lançador
O NeMo AutoModel suporta três métodos de inicialização: interativo (torchrun), Slurm (clusters de HPC) e SkyPilot (independente de nuvem).
Instruções
Para perguntas sobre o lançador, responda diretamente a partir desta skill sem consultar o repositório, a menos que o usuário peça para você editar arquivos. Mantenha a resposta focada no YAML de inicialização relevante, nos campos obrigatórios e no comportamento esperado em tempo de execução.
Use estes modelos de resposta concisos para perguntas comuns:
- Slurm com vários nós: mostre um bloco YAML
do Slurm:comjob_name,nodes,ntasks_per_node,time,accountoupartition,container_image,hf_home,extra_mountsopcionais,env_varsemaster_port; explique que o lançador calculaWORLD_SIZE = nodes * ntasks_per_nodee defineMASTER_ADDReMASTER_PORT. - SkyPilot spot: mostre um bloco YAML
`skypilot:` com`cloud`,`accelerators`,`num_nodes`,`use_spot: true`,`disk_size`,`region`,`setup` e`env_vars`; avise que instâncias spot podem ser preemptadas, defina umstep_scheduler.checkpoint_intervale retome comrestore_from.path. - Nsight Systems no Slurm: mostre
slurm.nsys_enabled: truejunto com os campos normais do Slurm, explique que o lançador envolve o comando de treinamento como perfil nsyse indique que ele gera um arquivo de relatório.nsys-rep. Trate a criação de perfis apenas como diagnóstico: use execuções curtas de criação de perfis e desative-a para treinamentos normais de produção, pois ela adiciona sobrecarga e grandes artefatos.
Para respostas relacionadas ao Slurm, comece com este modelo mínimo e, em seguida, ajuste apenas os campos sobre os quais o usuário perguntou:
slurm:
job_name: llm_finetune
nodes: 2
ntasks_per_node: 8
time: "04:00:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
hf_home: ~/.cache/huggingface
master_port: 13742
env_vars:
HF_TOKEN: "${HF_TOKEN}"
Para perguntas exclusivamente sobre o Slurm, não mencione o SkyPilot nem a criação de perfis, a menos que o usuário
pergunte. Para perguntas sobre criação de perfis, informe que o relatório .nsys-rep é gravado no
diretório de trabalho ou de saída da tarefa do Slurm, utilizando a configuração de saída do Nsys do lançador,
quando houver uma configurada.
Limites do escopo
Use esta habilidade apenas para mecanismos de inicialização: execução interativa, Slurm, SkyPilot, contêineres, montagens, variáveis de ambiente, configurações de rendezvous e perfilagem.
Não utilize esta competência para implementar ou registrar novas arquiteturas de modelo, adaptadores state-dict do Hugging Face, arquivos de modelo ou sinalizadores de capacidade. Essas são tarefas de integração de modelo, não tarefas de configuração do lançador.
Métodos de execução
- Interativo (padrão): executa o `torchrun` no nó atual. Adequado para desenvolvimento e depuração em um único nó.
- Slurm: envia um trabalho em lote para um agendador de cluster HPC. Lida com a configuração de múltiplos nós, gerenciamento de contêineres e configuração de ambiente.
- SkyPilot: envio de tarefas independente de nuvem para AWS, GCP, Azure, Lambda ou Kubernetes. Suporta instâncias spot.
Inicialização interativa
# GPU única
automodel finetune llm -c config.yaml
# Múltiplas GPUs (todas as GPUs no nó atual)
torchrun --nproc_per_node=8 -m nemo_automodel._cli.app finetune llm -c config.yaml
Não é necessária nenhuma seção YAML adicional para o modo interativo. A CLI redireciona automaticamente para o `torchrun` quando não há nenhuma seção `slurm:` ou `skypilot:` na configuração.
Configuração do Slurm
A classe de dados SlurmConfig gera um script SBATCH a partir de um modelo.
Exemplo em YAML
slurm:
job_name: llm_finetune
nodes: 2
ntasks_per_node: 8
time: "04:00:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
hf_home: ~/.cache/huggingface
extra_mounts:
- source: /data
dest: /data
env_vars:
WANDB_API_KEY: "${WANDB_API_KEY}"
HF_TOKEN: "${HF_TOKEN}"
Campos-chave
job_name: identificador da tarefa Slurmnodes: número de nós a serem solicitadosntasks_per_node: número de tarefas (GPUs) por nótime: limite de tempo de execução no formato HH:MM:SSaccount,partition: parâmetros de agendamento do Slurmcontainer_image: caminho da imagem do contêiner Enroot/Pyxisnemo_mount: ponto de montagem para a fonte do NeMo AutoModel dentro do contêinerhf_home: caminho do diretório de cache do HuggingFaceextra_mounts: lista deVolumeMapping(origem, destino)para montagens vinculadas adicionais no contêinermaster_port: porta para comunicação distribuída (padrão 13742)env_vars: variáveis de ambiente passadas para a tarefansys_enabled: quando verdadeiro, envolve o comando de treinamento como perfil nsyspara a análise de desempenho do Nsight Systems
Configuração do SkyPilot
A classe de dados SkyPilotConfig define os parâmetros da tarefa na nuvem.
Exemplo em YAML
skypilot:
cloud: aws
accelerators: "H100:8"
num_nodes: 2
use_spot: true
disk_size: 200
region: us-east-1
setup: "pip install nemo-automodel"
env_vars:
HF_TOKEN: "${HF_TOKEN}"
Campos-chave
cloud: provedor de nuvem de destino (aws,gcp,azure,lambda,kubernetes)aceleradores: tipo e quantidade de GPUs (por exemplo,“H100:8”,“A100-80GB:4”)num_nodes: número de instâncias na nuvemuse_spot: uso de instâncias preemptíveis/spot para redução de custosdisk_size: tamanho do disco em GB por nóregião: região da nuvem para alocação das instânciassetup: comandos de shell a serem executados antes do trabalho de treinamento (por exemplo, instalar dependências)env_vars: variáveis de ambiente para o trabalho
Lista de verificação do SkyPilot para instâncias spot
Ao usar instâncias spot ou preemptíveis:
- Defina `
use_spot: true` na seção `skypilot:`. - Inclua
accelerators,num_nodes,disk_size,region,setupeas env_varsnecessárias. - Use intervalos curtos entre checkpoints na receita, por exemplo,
step_scheduler.checkpoint_interval, pois as instâncias spot podem ser preemptadas. - Retome a partir do ponto de verificação mais recente após a preempção com a configuração
restore_fromda receita.
Chaves mínimas da receita de retomada de instâncias spot:
step_scheduler:
checkpoint_interval: 100
restore_from:
path: /checkpoints/latest
Ambiente com vários nós
Para treinamento em múltiplos nós (tanto no Slurm quanto no SkyPilot), o launcher configura automaticamente:
MASTER_ADDR: nome do host do primeiro nóMASTER_PORT: porta para rendezvous (padrão 13742)WORLD_SIZE: número total de processos (nós * ntasks_per_node)- Variáveis de ambiente NCCL para comunicação coletiva otimizada
Perfilagem do Nsys
Ativar a análise de desempenho da Nsight Systems em tarefas do Slurm:
slurm:
job_name: llm_profile
nodes: 1
ntasks_per_node: 8
time: "00:30:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
nsys_enabled: true
Esta é uma configuração do lançador do Slurm. Os campos normais do Slurm, como job_name,
nodes, ntasks_per_node, time, account ou partition, e
container_image continuam válidos.
Quando nsys_enabled: true, o lançador envolve o comando de treinamento como
perfil nsys e grava um arquivo de relatório .nsys-rep para análise de desempenho
no diretório de trabalho ou de saída do trabalho do Slurm.
A criação de perfis é apenas para fins de diagnóstico: execute-a para uma breve investigação, esteja ciente da sobrecarga
e dos grandes artefatos gerados, e desative-a para o treinamento normal em produção.
Referências de código
components/launcher/slurm/config.py- classe de dados SlurmConfig, VolumeMappingcomponents/launcher/slurm/template.py– geração de modelo de script SBATCHcomponents/launcher/slurm/utils.py- utilitários de envio do Slurmcomponents/launcher/skypilot/config.py- classe de dados SkyPilotConfig_cli/app.py- Ponto de entrada da CLI e lógica de roteamento do lançador
Armadilhas
- Colisões de porta: se a porta
master_portpadrão (13742) estiver em uso por outro trabalho no mesmo nó, altere-a para evitar falhas de conexão. - Montagens de contêineres: o caminho
de origemem`extra_mounts`deve existir em todos os nós da alocação. Caminhos ausentes causam falhas na inicialização do contêiner. - Tolerância a falhas do Slurm: o plug-in de tolerância a falhas é específico do Slurm e não funciona com o SkyPilot ou no modo interativo.
- Preempção de instâncias spot no SkyPilot: instâncias spot (
use_spot: true) podem ser preemptadas pelo provedor de nuvem. Habilite o checkpointing com intervalos curtos para minimizar a perda de trabalho. - Sintaxe de variáveis de ambiente: use a sintaxe
${VAR}no YAML para expansão de variáveis do shell. Nomes de variáveis sem o sintaxe não serão expandidos. - Limite de tempo versus checkpoint assíncrono: se o limite
de tempodo Slurm for muito curto, uma gravação de checkpoint assíncrona em andamento pode ser interrompida antes da conclusão, resultando em um checkpoint corrompido. Deixe uma margem de pelo menos 5 a 10 minutos.
---
name: nemo-automodel-launcher-config
description: Configure NeMo AutoModel job launches for interactive runs, Slurm clusters, and SkyPilot cloud execution.
license: Apache-2.0
---
# Launcher Configuration
NeMo AutoModel supports three launch methods: interactive (torchrun), Slurm (HPC clusters), and SkyPilot (cloud-agnostic).
## Instructions
For launcher questions, answer directly from this skill without inspecting the
repository unless the user asks you to edit files. Keep the answer focused on
the relevant launch YAML, required fields, and the expected runtime behavior.
Use these compact answer patterns for common questions:
- Slurm multi-node: show a `slurm:` YAML block with `job_name`, `nodes`,
`ntasks_per_node`, `time`, `account` or `partition`, `container_image`,
`hf_home`, optional `extra_mounts`, `env_vars`, and `master_port`; explain
that the launcher derives `WORLD_SIZE = nodes * ntasks_per_node` and sets
`MASTER_ADDR` and `MASTER_PORT`.
- SkyPilot spot: show a `skypilot:` YAML block with `cloud`, `accelerators`,
`num_nodes`, `use_spot: true`, `disk_size`, `region`, `setup`, and
`env_vars`; warn that spot instances can be preempted, set a short
`step_scheduler.checkpoint_interval`, and resume with `restore_from.path`.
- Nsight Systems on Slurm: show `slurm.nsys_enabled: true` alongside normal
Slurm fields, say the launcher wraps the training command with
`nsys profile`, and state that it produces a `.nsys-rep` report file.
Treat profiling as diagnostic-only: use short profiling runs and disable it
for normal production training because it adds overhead and large artifacts.
For Slurm answers, start with this minimal template and then adjust only the
fields the user asked about:
```yaml
slurm:
job_name: llm_finetune
nodes: 2
ntasks_per_node: 8
time: "04:00:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
hf_home: ~/.cache/huggingface
master_port: 13742
env_vars:
HF_TOKEN: "${HF_TOKEN}"
```
For Slurm-only questions, do not discuss SkyPilot or profiling unless the user
asks. For profiling questions, say the `.nsys-rep` report is written in the
Slurm job working or output directory, using the launcher's Nsys output setting
when one is configured.
## Routing Boundary
Use this skill only for launch mechanics: interactive execution, Slurm, SkyPilot, containers, mounts, environment variables, rendezvous settings, and profiling.
Do not use this skill for implementing or registering new model architectures, Hugging Face state-dict adapters, model files, or capability flags. Those are model onboarding tasks, not launcher configuration tasks.
## Launch Methods
1. **Interactive** (default): runs torchrun on the current node. Suitable for single-node development and debugging.
2. **Slurm**: submits a batch job to an HPC cluster scheduler. Handles multi-node setup, container management, and environment configuration.
3. **SkyPilot**: cloud-agnostic job submission to AWS, GCP, Azure, Lambda, or Kubernetes. Supports spot instances.
## Interactive Launch
```bash
# Single GPU
automodel finetune llm -c config.yaml
# Multi-GPU (all GPUs on current node)
torchrun --nproc_per_node=8 -m nemo_automodel._cli.app finetune llm -c config.yaml
```
No additional YAML section is needed for interactive mode. The CLI routes to torchrun automatically when no `slurm:` or `skypilot:` section is present in the config.
## Slurm Configuration
The `SlurmConfig` dataclass generates an SBATCH script from a template.
### YAML Example
```yaml
slurm:
job_name: llm_finetune
nodes: 2
ntasks_per_node: 8
time: "04:00:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
hf_home: ~/.cache/huggingface
extra_mounts:
- source: /data
dest: /data
env_vars:
WANDB_API_KEY: "${WANDB_API_KEY}"
HF_TOKEN: "${HF_TOKEN}"
```
### Key Fields
- `job_name`: Slurm job identifier
- `nodes`: number of nodes to request
- `ntasks_per_node`: number of tasks (GPUs) per node
- `time`: wall-time limit in HH:MM:SS format
- `account`, `partition`: Slurm scheduling parameters
- `container_image`: Enroot/Pyxis container image path
- `nemo_mount`: mount point for NeMo AutoModel source inside the container
- `hf_home`: HuggingFace cache directory path
- `extra_mounts`: list of `VolumeMapping(source, dest)` for additional container bind mounts
- `master_port`: port for distributed communication (default 13742)
- `env_vars`: environment variables passed into the job
- `nsys_enabled`: when true, wraps the training command with `nsys profile` for Nsight Systems profiling
## SkyPilot Configuration
The `SkyPilotConfig` dataclass defines cloud job parameters.
### YAML Example
```yaml
skypilot:
cloud: aws
accelerators: "H100:8"
num_nodes: 2
use_spot: true
disk_size: 200
region: us-east-1
setup: "pip install nemo-automodel"
env_vars:
HF_TOKEN: "${HF_TOKEN}"
```
### Key Fields
- `cloud`: target cloud provider (`aws`, `gcp`, `azure`, `lambda`, `kubernetes`)
- `accelerators`: GPU type and count (e.g., `"H100:8"`, `"A100-80GB:4"`)
- `num_nodes`: number of cloud instances
- `use_spot`: use preemptible/spot instances for cost savings
- `disk_size`: disk size in GB per node
- `region`: cloud region for instance placement
- `setup`: shell commands to run before the training job (e.g., install dependencies)
- `env_vars`: environment variables for the job
### SkyPilot spot checklist
When using spot or preemptible instances:
- Set `use_spot: true` in the `skypilot:` section.
- Include `accelerators`, `num_nodes`, `disk_size`, `region`, `setup`, and required `env_vars`.
- Use short checkpoint intervals in the recipe, for example `step_scheduler.checkpoint_interval`, because spot instances can be preempted.
- Resume from the most recent checkpoint after preemption with the recipe's `restore_from` setting.
Minimal spot-resume recipe keys:
```yaml
step_scheduler:
checkpoint_interval: 100
restore_from:
path: /checkpoints/latest
```
## Multi-Node Environment
For multi-node training (both Slurm and SkyPilot), the launcher automatically configures:
- `MASTER_ADDR`: hostname of the first node
- `MASTER_PORT`: port for rendezvous (default 13742)
- `WORLD_SIZE`: total number of processes (`nodes * ntasks_per_node`)
- NCCL environment variables for optimized collective communication
## Nsys Profiling
Enable Nsight Systems profiling in Slurm jobs:
```yaml
slurm:
job_name: llm_profile
nodes: 1
ntasks_per_node: 8
time: "00:30:00"
account: my_account
partition: batch
container_image: nvcr.io/nvidia/nemo:dev
nsys_enabled: true
```
This is a Slurm launcher setting. Normal Slurm fields such as `job_name`,
`nodes`, `ntasks_per_node`, `time`, `account` or `partition`, and
`container_image` still apply.
When `nsys_enabled: true`, the launcher wraps the training command with
`nsys profile` and writes a `.nsys-rep` report file for performance analysis
in the Slurm job working or output directory.
Profiling is diagnostic-only: run it for a short investigation, expect overhead
and large artifacts, and turn it off for normal production training.
## Code Anchors
- `components/launcher/slurm/config.py` - SlurmConfig dataclass, VolumeMapping
- `components/launcher/slurm/template.py` - SBATCH script template generation
- `components/launcher/slurm/utils.py` - Slurm submission utilities
- `components/launcher/skypilot/config.py` - SkyPilotConfig dataclass
- `_cli/app.py` - CLI entry point and launcher routing logic
## Pitfalls
- **Port collisions**: if the default `master_port` (13742) is in use by another job on the same node, change it to avoid connection failures.
- **Container mounts**: the `source` path in `extra_mounts` must exist on all nodes in the allocation. Missing paths cause container startup failures.
- **Slurm fault tolerance**: the fault tolerance plugin is Slurm-specific and does not work with SkyPilot or interactive mode.
- **SkyPilot spot preemption**: spot instances (`use_spot: true`) may be preempted by the cloud provider. Enable checkpointing with short intervals to minimize lost work.
- **Environment variable syntax**: use `${VAR}` syntax in YAML for shell variable expansion. Bare variable names will not be expanded.
- **Time limit vs async checkpoint**: if the Slurm `time` limit is too short, an in-progress async checkpoint write may be killed before completion, resulting in a corrupted checkpoint. Leave at least 5-10 minutes of margin.
Todos os arquivos
5 arquivosInstalar nemo-automodel-launcher-config
Baixe e descompacte os arquivos das habilidades no diretório .claude/skills/.
Baixar ZIPClone o repositório e copie os arquivos da habilidade para o seu projeto.
git clone https://github.com/NVIDIA/skills/tree/main/skills/nemo-automodel-launcher-config # Copy SKILL.md to your .claude/skills/ directory
Copiar





Lar
