вариант
ДомДом Skill DevOps и CI/CD nemo-automodel-launcher-config

nemo-automodel-launcher-config

NVIDIA/skills NVIDIA/skills

Настройте запуск заданий NeMo AutoModel для интерактивного выполнения, кластеров Slurm и облачного выполнения в SkyPilot.

...Расширить все
1
Обновлено время 28 сентября 2026 г.

Настройка запуска

NeMo AutoModel поддерживает три метода запуска: интерактивный (torchrun), Slurm (HPC-кластеры) и SkyPilot (независимый от облачной платформы).

Инструкции

На вопросы, касающиеся запуска, отвечайте непосредственно из этого навыка, не заглядывая в репозиторий, если только пользователь не попросит вас отредактировать файлы. Сосредоточьте ответ на соответствующем YAML-файле запуска, обязательных полях и ожидаемом поведении во время выполнения.

Используйте следующие лаконичные шаблоны ответов на типичные вопросы:

  • Slurm с несколькими узлами: покажите блок YAML slurm: с job_name, nodes, ntasks_per_node, time, account или partition, container_image, hf_home, опциональными extra_mounts, env_vars и master_port; объясните, что запускающий модуль вычисляет WORLD_SIZE = nodes * ntasks_per_node и устанавливает MASTER_ADDR и MASTER_PORT.
  • Spot-инстанс SkyPilot: покажите блок YAML skypilot: с cloud, accelerators, num_nodes, use_spot: true, disk_size, region, setup и env_vars; предупредите, что spot-инстансы могут быть прерваны, установите короткий step_scheduler.checkpoint_interval и возобновить работу с помощью restore_from.path.
  • Nsight Systems на Slurm: покажите slurm.nsys_enabled: true наряду с обычными полями Slurm, укажите, что запускающая программа обертывает команду обучения с помощью профиля nsys, и сообщите, что она генерирует файл отчёта .nsys-rep. Рассматривайте профилирование исключительно как средство диагностики: используйте короткие циклы профилирования и отключайте его для обычного производственного обучения, поскольку оно увеличивает нагрузку и приводит к появлению значительных артефактов.

Для ответов, касающихся Slurm, начните с этого минимального шаблона, а затем настройте только те поля, о которых спросил пользователь:

slurm:
  job_name: llm_finetune
  nodes: 2
  ntasks_per_node: 8
  time: "04:00:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  hf_home: ~/.cache/huggingface
  master_port: 13742
  env_vars:
    HF_TOKEN: "${HF_TOKEN}"

Если вопрос касается исключительно Slurm, не обсуждайте SkyPilot или профилирование, пока пользователь сам не спросит об этом. По вопросам профилирования сообщите, что отчет .nsys-rep записывается в рабочий или выходной каталог задания Slurm с использованием настроек вывода Nsys запускающего модуля, если они настроены.

Границы компетенции

Используйте этот навык только для механизмов запуска: интерактивного выполнения, Slurm, SkyPilot, контейнеров, монтирования, переменных среды, настроек rendezvous и профилирования.

Не используйте эту компетенцию для реализации или регистрации новых архитектур моделей, адаптеров Hugging Face state-dict, файлов моделей или флагов возможностей. Это задачи по внедрению моделей, а не по настройке запуска.

Методы запуска

  1. Интерактивный (по умолчанию): запускает torchrun на текущем узле. Подходит для разработки и отладки на одном узле.
  2. Slurm: отправляет пакетную задачу в планировщик кластера HPC. Обеспечивает настройку на нескольких узлах, управление контейнерами и настройку среды.
  3. SkyPilot: отправка заданий независимо от облачной платформы в AWS, GCP, Azure, Lambda или Kubernetes. Поддерживает спотовые инстансы.

Интерактивный запуск

# Один графический процессор
automodel finetune llm -c config.yaml

# Несколько графических процессоров (все графические процессоры на текущем узле)
torchrun --nproc_per_node=8 -m nemo_automodel._cli.app finetune llm -c config.yaml

Для интерактивного режима не требуется дополнительный раздел YAML. CLI автоматически перенаправляет запрос в torchrun, если в конфигурации отсутствует раздел slurm: или skypilot:.

Настройка Slurm

Класс данных SlurmConfig генерирует скрипт SBATCH на основе шаблона.

Пример YAML

slurm:
  job_name: llm_finetune
  nodes: 2
  ntasks_per_node: 8
  time: "04:00:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  hf_home: ~/.cache/huggingface
  extra_mounts:
    - source: /data
      dest: /data
  env_vars:
    WANDB_API_KEY: "${WANDB_API_KEY}"
    HF_TOKEN: "${HF_TOKEN}"

Ключевые поля

  • job_name: идентификатор задания Slurm
  • nodes: количество узлов, которые необходимо задействовать
  • ntasks_per_node: количество задач (GPU) на каждый узел
  • time: ограничение по реальному времени в формате ЧЧ:ММ:СС
  • account, partition: параметры планирования Slurm
  • container_image: путь к образу контейнера Enroot/Pyxis
  • nemo_mount: точка монтирования исходного кода NeMo AutoModel внутри контейнера
  • hf_home: путь к каталогу кэша HuggingFace
  • extra_mounts: список VolumeMapping(источник, назначение) для дополнительных привязок контейнера
  • master_port: порт для распределённой связи (по умолчанию 13742)
  • env_vars: переменные среды, передаваемые в задание
  • nsys_enabled: если значение true, команда обучения оборачивается профилем nsys для профилирования Nsight Systems

Настройка SkyPilot

Класс данных SkyPilotConfig определяет параметры облачного задания.

Пример YAML

skypilot:
  cloud: aws
  accelerators: "H100:8"
  num_nodes: 2
  use_spot: true
  disk_size: 200
  region: us-east-1
  setup: "pip install nemo-automodel"
  env_vars:
    HF_TOKEN: "${HF_TOKEN}"

Ключевые поля

  • cloud: целевой поставщик облачных услуг (aws, gcp, azure, lambda, kubernetes)
  • accelerators: тип и количество графических процессоров (например, «H100:8», «A100-80GB:4»)
  • num_nodes: количество облачных инстансов
  • use_spot: использование преемптивных/спотовых инстансов для снижения затрат
  • disk_size: размер диска в ГБ на узел
  • region: регион облака для размещения экземпляров
  • setup: команды оболочки, которые необходимо запустить перед запуском задания обучения (например, установка зависимостей)
  • env_vars: переменные среды для задания

Контрольный список SkyPilot для спотовых инстансов

При использовании спотовых или преемтибельных экземпляров:

  • Укажите use_spot: true в разделе skypilot:.
  • Укажите ускорители, num_nodes, disk_size, регион, настройки и необходимые env_vars.
  • Используйте короткие интервалы создания контрольных точек в рецепте, например step_scheduler.checkpoint_interval, поскольку спотовые инстансы могут быть преемптивно отключены.
  • После преемпции возобновляйте работу с самой последней контрольной точки с помощью параметра restore_from в рецепте.

Минимальные ключи рецепта для возобновления работы после прерывания спот-инстанса:

step_scheduler:
  checkpoint_interval: 100

restore_from:
  path: /checkpoints/latest

Среда с несколькими узлами

Для обучения в многоузловой среде (как Slurm, так и SkyPilot) запускающая программа автоматически настраивает:

  • MASTER_ADDR: имя хоста первого узла
  • MASTER_PORT: порт для rendezvous (по умолчанию 13742)
  • WORLD_SIZE: общее количество процессов (nodes * ntasks_per_node)
  • Переменные среды NCCL для оптимизированной коллективной коммуникации

Профилирование Nsys

Включение профилирования Nsight Systems в заданиях Slurm:

slurm:
  job_name: llm_profile
  nodes: 1
  ntasks_per_node: 8
  time: "00:30:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  nsys_enabled: true

Это настройка запуска Slurm. Обычные поля Slurm, такие как job_name, nodes, ntasks_per_node, time, account или partition, а также container_image по-прежнему применяются.

Когда nsys_enabled: true, запускатель обертывает команду обучения с помощью профиля nsys и записывает файл отчёта .nsys-rep для анализа производительности в рабочий или выходной каталог задания Slurm. Профилирование предназначено только для диагностики: запускайте его для кратковременного исследования, учитывайте дополнительную нагрузку и большие артефакты, а для обычного производственного обучения отключайте его.

Ссылки на код

  • components/launcher/slurm/config.py — класс данных SlurmConfig, VolumeMapping
  • components/launcher/slurm/template.py — генерация шаблонов скриптов SBATCH
  • components/launcher/slurm/utils.py — утилиты отправки заданий Slurm
  • components/launcher/skypilot/config.py — класс данных SkyPilotConfig
  • _cli/app.py — точка входа CLI и логика маршрутизации запуска

Проблемы

  • Конфликты портов: если порт master_port по умолчанию (13742) используется другим заданием на том же узле, измените его, чтобы избежать сбоев при подключении.
  • Монтирование контейнеров: путь к исходным файлам, указанный в extra_mounts, должен существовать на всех узлах в выделенном ресурсе. Отсутствие путей приводит к сбоям при запуске контейнеров.
  • Отказоустойчивость Slurm: плагин отказоустойчивости специфичен для Slurm и не работает с SkyPilot или в интерактивном режиме.
  • Прерывание спот-инстансов SkyPilot: спот-инстансы (use_spot: true) могут быть прерваны поставщиком облачных услуг. Включите создание контрольных точек с короткими интервалами, чтобы свести к минимуму потерю выполненной работы.
  • Синтаксис переменных среды: используйте синтаксис ${VAR} в YAML для расширения переменных оболочки. Простые имена переменных не будут расширяться.
  • Ограничение по времени и асинхронная контрольная точка: если ограничение по времени в Slurm слишком короткое, выполняющаяся запись асинхронной контрольной точки может быть прервана до завершения, что приведёт к повреждению контрольной точки. Оставьте запас времени не менее 5–10 минут.
Посмотреть на GitHub
---
name: nemo-automodel-launcher-config
description: Configure NeMo AutoModel job launches for interactive runs, Slurm clusters, and SkyPilot cloud execution.
license: Apache-2.0
---

# Launcher Configuration

NeMo AutoModel supports three launch methods: interactive (torchrun), Slurm (HPC clusters), and SkyPilot (cloud-agnostic).

## Instructions

For launcher questions, answer directly from this skill without inspecting the
repository unless the user asks you to edit files. Keep the answer focused on
the relevant launch YAML, required fields, and the expected runtime behavior.

Use these compact answer patterns for common questions:

- Slurm multi-node: show a `slurm:` YAML block with `job_name`, `nodes`,
  `ntasks_per_node`, `time`, `account` or `partition`, `container_image`,
  `hf_home`, optional `extra_mounts`, `env_vars`, and `master_port`; explain
  that the launcher derives `WORLD_SIZE = nodes * ntasks_per_node` and sets
  `MASTER_ADDR` and `MASTER_PORT`.
- SkyPilot spot: show a `skypilot:` YAML block with `cloud`, `accelerators`,
  `num_nodes`, `use_spot: true`, `disk_size`, `region`, `setup`, and
  `env_vars`; warn that spot instances can be preempted, set a short
  `step_scheduler.checkpoint_interval`, and resume with `restore_from.path`.
- Nsight Systems on Slurm: show `slurm.nsys_enabled: true` alongside normal
  Slurm fields, say the launcher wraps the training command with
  `nsys profile`, and state that it produces a `.nsys-rep` report file.
  Treat profiling as diagnostic-only: use short profiling runs and disable it
  for normal production training because it adds overhead and large artifacts.

For Slurm answers, start with this minimal template and then adjust only the
fields the user asked about:

```yaml
slurm:
  job_name: llm_finetune
  nodes: 2
  ntasks_per_node: 8
  time: "04:00:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  hf_home: ~/.cache/huggingface
  master_port: 13742
  env_vars:
    HF_TOKEN: "${HF_TOKEN}"
```

For Slurm-only questions, do not discuss SkyPilot or profiling unless the user
asks. For profiling questions, say the `.nsys-rep` report is written in the
Slurm job working or output directory, using the launcher's Nsys output setting
when one is configured.

## Routing Boundary

Use this skill only for launch mechanics: interactive execution, Slurm, SkyPilot, containers, mounts, environment variables, rendezvous settings, and profiling.

Do not use this skill for implementing or registering new model architectures, Hugging Face state-dict adapters, model files, or capability flags. Those are model onboarding tasks, not launcher configuration tasks.

## Launch Methods

1. **Interactive** (default): runs torchrun on the current node. Suitable for single-node development and debugging.
2. **Slurm**: submits a batch job to an HPC cluster scheduler. Handles multi-node setup, container management, and environment configuration.
3. **SkyPilot**: cloud-agnostic job submission to AWS, GCP, Azure, Lambda, or Kubernetes. Supports spot instances.

## Interactive Launch

```bash
# Single GPU
automodel finetune llm -c config.yaml

# Multi-GPU (all GPUs on current node)
torchrun --nproc_per_node=8 -m nemo_automodel._cli.app finetune llm -c config.yaml
```

No additional YAML section is needed for interactive mode. The CLI routes to torchrun automatically when no `slurm:` or `skypilot:` section is present in the config.

## Slurm Configuration

The `SlurmConfig` dataclass generates an SBATCH script from a template.

### YAML Example

```yaml
slurm:
  job_name: llm_finetune
  nodes: 2
  ntasks_per_node: 8
  time: "04:00:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  hf_home: ~/.cache/huggingface
  extra_mounts:
    - source: /data
      dest: /data
  env_vars:
    WANDB_API_KEY: "${WANDB_API_KEY}"
    HF_TOKEN: "${HF_TOKEN}"
```

### Key Fields

- `job_name`: Slurm job identifier
- `nodes`: number of nodes to request
- `ntasks_per_node`: number of tasks (GPUs) per node
- `time`: wall-time limit in HH:MM:SS format
- `account`, `partition`: Slurm scheduling parameters
- `container_image`: Enroot/Pyxis container image path
- `nemo_mount`: mount point for NeMo AutoModel source inside the container
- `hf_home`: HuggingFace cache directory path
- `extra_mounts`: list of `VolumeMapping(source, dest)` for additional container bind mounts
- `master_port`: port for distributed communication (default 13742)
- `env_vars`: environment variables passed into the job
- `nsys_enabled`: when true, wraps the training command with `nsys profile` for Nsight Systems profiling

## SkyPilot Configuration

The `SkyPilotConfig` dataclass defines cloud job parameters.

### YAML Example

```yaml
skypilot:
  cloud: aws
  accelerators: "H100:8"
  num_nodes: 2
  use_spot: true
  disk_size: 200
  region: us-east-1
  setup: "pip install nemo-automodel"
  env_vars:
    HF_TOKEN: "${HF_TOKEN}"
```

### Key Fields

- `cloud`: target cloud provider (`aws`, `gcp`, `azure`, `lambda`, `kubernetes`)
- `accelerators`: GPU type and count (e.g., `"H100:8"`, `"A100-80GB:4"`)
- `num_nodes`: number of cloud instances
- `use_spot`: use preemptible/spot instances for cost savings
- `disk_size`: disk size in GB per node
- `region`: cloud region for instance placement
- `setup`: shell commands to run before the training job (e.g., install dependencies)
- `env_vars`: environment variables for the job

### SkyPilot spot checklist

When using spot or preemptible instances:

- Set `use_spot: true` in the `skypilot:` section.
- Include `accelerators`, `num_nodes`, `disk_size`, `region`, `setup`, and required `env_vars`.
- Use short checkpoint intervals in the recipe, for example `step_scheduler.checkpoint_interval`, because spot instances can be preempted.
- Resume from the most recent checkpoint after preemption with the recipe's `restore_from` setting.

Minimal spot-resume recipe keys:

```yaml
step_scheduler:
  checkpoint_interval: 100

restore_from:
  path: /checkpoints/latest
```

## Multi-Node Environment

For multi-node training (both Slurm and SkyPilot), the launcher automatically configures:
- `MASTER_ADDR`: hostname of the first node
- `MASTER_PORT`: port for rendezvous (default 13742)
- `WORLD_SIZE`: total number of processes (`nodes * ntasks_per_node`)
- NCCL environment variables for optimized collective communication

## Nsys Profiling

Enable Nsight Systems profiling in Slurm jobs:

```yaml
slurm:
  job_name: llm_profile
  nodes: 1
  ntasks_per_node: 8
  time: "00:30:00"
  account: my_account
  partition: batch
  container_image: nvcr.io/nvidia/nemo:dev
  nsys_enabled: true
```

This is a Slurm launcher setting. Normal Slurm fields such as `job_name`,
`nodes`, `ntasks_per_node`, `time`, `account` or `partition`, and
`container_image` still apply.

When `nsys_enabled: true`, the launcher wraps the training command with
`nsys profile` and writes a `.nsys-rep` report file for performance analysis
in the Slurm job working or output directory.
Profiling is diagnostic-only: run it for a short investigation, expect overhead
and large artifacts, and turn it off for normal production training.

## Code Anchors

- `components/launcher/slurm/config.py` - SlurmConfig dataclass, VolumeMapping
- `components/launcher/slurm/template.py` - SBATCH script template generation
- `components/launcher/slurm/utils.py` - Slurm submission utilities
- `components/launcher/skypilot/config.py` - SkyPilotConfig dataclass
- `_cli/app.py` - CLI entry point and launcher routing logic

## Pitfalls

- **Port collisions**: if the default `master_port` (13742) is in use by another job on the same node, change it to avoid connection failures.
- **Container mounts**: the `source` path in `extra_mounts` must exist on all nodes in the allocation. Missing paths cause container startup failures.
- **Slurm fault tolerance**: the fault tolerance plugin is Slurm-specific and does not work with SkyPilot or interactive mode.
- **SkyPilot spot preemption**: spot instances (`use_spot: true`) may be preempted by the cloud provider. Enable checkpointing with short intervals to minimize lost work.
- **Environment variable syntax**: use `${VAR}` syntax in YAML for shell variable expansion. Bare variable names will not be expanded.
- **Time limit vs async checkpoint**: if the Slurm `time` limit is too short, an in-progress async checkpoint write may be killed before completion, resulting in a corrupted checkpoint. Leave at least 5-10 minutes of margin.

Установить nemo-automodel-launcher-config

Скачайте файлы навыков и распакуйте их в каталог .claude/skills/.

Скачать ZIP

Клонируйте репозиторий и скопируйте файлы навыка в свой проект.

git clone https://github.com/NVIDIA/skills/tree/main/skills/nemo-automodel-launcher-config # Copy SKILL.md to your .claude/skills/ directory

Копировать Копировать
Быстрая настройка: Скопируйте папку со скиллом в каталог .claude/skills/ Claude автоматически обнаружит и начнет использовать этот скилл
Репозиторий NVIDIA/skills

Похожие навыки

klingai-upgrade-migration
Обновлено время 3 июля 2026 г.
Verification & Quality Assurance
Обновлено время 29 июня 2026 г.
base44-cli
Обновлено время 29 июня 2026 г.
Railway CLI Management
Обновлено время 2 июля 2026 г.
OR