Option
HeimHeim Skill DevOps und CI/CD tao-setup-nvidia-gpu-host

tao-setup-nvidia-gpu-host

NVIDIA/skills NVIDIA/skills

Überprüft und installiert den NVIDIA-Treiber, das CUDA Toolkit und das NVIDIA Container Toolkit für GPU-beschleunigte Docker- und Kubernetes-Hosts. Unterstützt mehrere Linux-Distributionen mit automatisierter Installation und Prüfmodi im schreibgeschützten Modus.

...Alle erweitern
4
Zeit aktualisiert 27. September 2026

Einrichtung des NVIDIA-GPU-Hosts

Verwenden Sie diese Einrichtungsfunktion, bevor TAO-Workflows auf dem Docker-, Local-Docker- oder Kubernetes-Backend ausgeführt werden. Sie standardisiert die Host-GPU-Laufzeitumgebung auf:

  • NVIDIA-Treiberzweig 580 (vorzugsweise offenes Kernel-Modul)
  • CUDA-Toolkit-Paket „cuda-toolkit-13-0“
  • NVIDIA Container Toolkit 1.19.0
  • Docker-Engine – wird nur für Docker- und „local-docker“-Backends installiert und nur dann, wenn Docker fehlt. Das ausgewählte Paket hängt von der Distributionsfamilie ab (standardmäßig„docker.io“ auf der Debian-Familie, „moby-engine“ / „docker-ce“ von download.docker.com auf der RHEL-Familie, „docker“ auf der SUSE-Familie). Übergeben Sie „--skip-docker-install“, um dies zu deaktivieren.

Die Überprüfung ist standardmäßig sicher und schreibgeschützt – sie funktioniert auf jeder Linux- Distribution, da lediglich nvidia-smi, der Pfad zum CUDA-Toolkit, die Version des installierten container-toolkit-Pakets (überdpkg/rpm/die nvidia-ctk-Binärversion ) sowie die NVIDIA-Laufzeitumgebung des Docker-Daemons überprüft werden.

Die Installation muss vom Benutzer ausdrücklich autorisiert und mit --install erneut ausgeführt werden. Der Installationspfad wird für folgende Distributionsfamilien automatisch festgelegt:

Familie Getestete Distributionen Manager Anmerkungen
Debian Ubuntu 22.04 / 24.04, Debian 12 (und Derivate wie Pop!_OS, Mint, Zorin, Raspbian, KDE Neon usw. über UBUNTU_CODENAME / VERSION_CODENAME) apt-get Fügt NVIDIA cuda-keyring + Container Toolkit .list hinzu. Docker über docker.io (überschreibt $DOCKER_PACKAGE_DEBIAN).
rhel Fedora 39+, RHEL / Rocky / AlmaLinux 9 und 10 dnf (oder yum) Fügt NVIDIA -cuda--Repo sowie das Container-Toolkit -Repo hinzu. Docker über die Fedora -Moby-Engine, sofern verfügbar, andernfalls docker-ce von download.docker.com.
suse openSUSE Leap 15, SLES 15 zypper Fügt dieselben NVIDIA -.repo -Dateien hinzu. Docker über das Docker -Paket der Distribution.
Sonstige (Arch, Alpine, Gentoo, NixOS, FreeBSD, …) k. A. k. A. --install beendet sich mit einer übersichtlichen Fehlermeldung, in der die Zielversionen und die URLs der NVIDIA-Installationsanleitungen aufgeführt sind. Führen Sie die Installation manuell durch und führen Sie anschließend --check-only erneut aus.

Schnellstart

Aus dem Stammverzeichnis der Skill-Bank:

# Überprüfen Sie den lokalen Docker-Backend-Host.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --check-only

# Nach Zustimmung des Benutzers installieren oder reparieren.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --install

# Einen Kubernetes-GPU-Worker-Host überprüfen.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend kubernetes --check-only

⚠️ Hinweis – nicht-interaktive Ausführung (Agent-/Skill-Läufe): Bei einem Skill-Lauf gibt es kein Terminal, daher kann die Eingabeaufforderung des Installationsprogramms „Continue? [y/N] “ nicht beantwortet werden. Nachdem Sie --check-only zur Vorschau ausgeführt und die Zustimmung des Benutzers eingeholt haben, fügen Sie das Flag „assume-yes“ (--yes) an den Befehl --install an, damit dieser ohne Abfrage fortfährt – dies bestätigt automatisch die Installation von Systempaketen (NVIDIA-Treiber, CUDA Toolkit, NVIDIA Container Toolkit und Docker für Docker-Backends) automatisch bestätigt und den Host verändert; führen Sie dies daher nur auf einem Host durch, über den Sie die Kontrolle haben. Wer „--install“ direkt in einem Terminal ausführt, erhält stattdessen die Abfrage.

Workflow-Vertrag

Docker- und Kubernetes-Workflows müssen vor der Übermittlung von GPU-Aufgaben die folgende Überprüfung durchführen:

SETUP_SCRIPT="${TAO_SKILL_BANK_ROOT:-$PWD}/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh"

bash "$SETUP_SCRIPT" --backend docker --check-only || {
  echo "FEHLT: Die TAO-GPU-Host-Laufzeitumgebung ist nicht bereit."
  echo "Nach der Zustimmung des Benutzers ausführen (für nicht-interaktive Agentenläufe --yes anhängen):"
  echo "  bash \"$SETUP_SCRIPT\" --backend docker --install"
  exit 1
}

Führen Sie die Installation niemals im Hintergrund durch. Wenn die Überprüfung fehlschlägt, erklären Sie, was fehlt, bitten Sie den Benutzer, die Korrektur zu genehmigen, führen Sie dann den Installationsbefehl aus und wiederholen Sie die Überprüfung.

Was der Installer tut

Das Installationsprogramm wählt die erkannte Distributionsfamilie aus. Bei jeder unterstützten Familie fügt es die Repositories von NVIDIA für CUDA und das Container Toolkit hinzu (falls fehlend), installiert die festgelegten Laufzeitpakete, installiert optional Docker, bindet die NVIDIA-Docker-Laufzeitumgebung ein und fügt den aufrufenden Benutzer zur Gruppe „docker“ hinzu.

Allgemeine Schritte (alle Familien):

  1. Fügt das CUDA-Repository von NVIDIA hinzu, falls es fehlt (apt cuda-keyring deb, cuda-.repo für dnf/zypper).
  2. Fügt das NVIDIA Container Toolkit-Repository hinzu, falls es fehlt (.list für apt, .repo für dnf/zypper).
  3. Installiert das passende Kernel-Header-/Devel-Paket für den laufenden Kernel.
  4. Installiert die Pakete des Treiberzweigs 580, „cuda-toolkit-13-0“ und das auf Version 1.19.0 festgelegte Container Toolkit (die mit „dpkg“ endende Version 1.19.0-1 entspricht derselben Upstream-Version, die für apt angegeben ist).
  5. Für Docker-Backends und wenn Docker fehlt, wird Docker installiert (Überschreibungs- bzw. Deaktivierungsflags siehe unten), der Daemon aktiviert und gestartet, anschließend wird `nvidia-ctk runtime configure --runtime=docker ` ausgeführt und Docker neu gestartet, sofern systemctl verfügbar ist.
  6. Fügt den aufrufenden Benutzer ($SUDO_USER, falls verfügbar, andernfalls $USER) zur Gruppe„docker“ hinzu, damit nachfolgende Shells Docker ohne sudo ausführen können — deaktivieren Sie dies mit --skip-docker-group. Die neue Gruppenmitgliedschaft wird in der aktuellen Shell nicht wirksam: Melden Sie sich ab und wieder an oder führen Sie in jeder neuen Shell„newgrp docker“ aus.
  7. Versucht „modprobe nvidia“, damit die Überprüfung vor dem Neustart erfolgreich verläuft.

Familienspezifische Paketauswahl:

Schritt Debian-Familie rhel-family suse-family
Kernel-Header linux-headers-$(uname -r) kernel-devel-$(uname -r), kernel-headers-$(uname -r) kernel-default-devel
Treiber nvidia-driver-pinning-580, nvidia-open-580 (Überschreibung: $NVIDIA_DRIVER_PACKAGE_DEBIAN) nvidia-driver-cuda, kmod-nvidia-open-dkms (Überschreibung: $NVIDIA_DRIVER_PACKAGE_RHEL, $NVIDIA_DRIVER_KMOD_RHEL) nvidia-open-driver-G06-signed-kmp-default (Überschreibung: $NVIDIA_DRIVER_PACKAGE_SUSE)
CUDA-Toolkit cuda-toolkit-13-0 cuda-toolkit-13-0 cuda-toolkit-13-0
Container-Toolkit nvidia-container-toolkit=1.19.0-1 + base/tools/libs nvidia-container-toolkit-1.19.0 + base/tools/libs wie bei RHEL
Docker docker.io (Überschreibung: $DOCKER_PACKAGE_DEBIAN) moby-engine+moby-cli unter Fedora, sofern verfügbar, andernfalls docker-ce docker-ce-cli containerd.io von download.docker.com Docker

Überprüfung

Überprüfen Sie nach der Installation Folgendes:

nvidia-smi
/usr/local/cuda-13.0/bin/nvcc --version
docker info --format '{{json .Runtimes}}' | grep nvidia
sudo docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smi

Die erwartete Ausgabe von `nvidia-smi` enthält den Treiber 580.x und CUDA-Version 13.0. Die erwartete Ausgabe von `nvcc` enthält die Version 13.0.

Hinweise zu Kubernetes

Bei selbstverwalteten Kubernetes-Clustern führen Sie das Host-Installationsprogramm auf jedem GPU- Worker-Knoten aus oder integrieren Sie denselben Paketsatz in das Knoten-Image, bevor Sie den NVIDIA GPU Operator oder das Geräte-Plugin installieren.

Die Workflow-Prüfung gibt außerdem eine Warnung aus, wenn „kubectl“ zwar verfügbar ist, der Cluster jedoch keine zuweisbare Kapazität für „nvidia.com/gpu“ meldet. Installieren und konfigurieren Sie in diesem Fall den NVIDIA GPU Operator, sobald die Laufzeitumgebung des Worker-Hosts bereit ist:

helm repo add nvidia https://helm.ngc.nvidia.com/nvidia
helm repo update
helm install --wait gpu-operator -n gpu-operator --create-namespace nvidia/gpu-operator

Managed-Kubernetes-Anbieter verwalten die Treiberinstallation möglicherweise über Node-Images oder die GPU-Operator-Richtlinie. Überschreiben Sie einen vom Anbieter verwalteten GPU-Knoten nicht ohne Zustimmung des Benutzers und einen Rollback-Plan.

Fehlermodi

Nicht unterstützte Distributionsfamilie: Der Befehl `--install` automatisiert Hosts der Debian-, RHEL- und SUSE-Familie. Unter Arch, Alpine, Gentoo, NixOS, FreeBSD oder Systemen ohne /etc/os-release (z. B. macOS) bricht das Skript mit einer eindeutigen Fehlermeldung ab, die die vier Versionsziele und die URLs der NVIDIA-Installationsanleitungen auflistet:

  • https://docs.nvidia.com/cuda/cuda-installation-guide-linux/
  • https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html
  • https://docs.docker.com/engine/install/

Installieren Sie diese vier Komponenten mithilfe des Paketmanagers Ihrer Distribution und führen Sie das Skript zur Überprüfung erneut mit der Option `--check-only` aus. Die Überprüfung ist universell portabel – sie fragt lediglich die Binärdateien bzw. Paketdatenbanken ab –, sodass, sobald die Laufzeitumgebung eingerichtet ist, die Anforderungen des Workflow-Vertrags unabhängig von der zugrunde liegenden Distribution erfüllt sind.

Nicht unterstützte Ubuntu-/Debian-Derivate: Wenn die ID z. B. „pop“, „mint“, „zorin“, „raspbian“ oder ein anderes Derivat der Debian-Familie ist, ordnet das Skript den Host über UBUNTU_CODENAME / VERSION_CODENAME (focal/jammy/noble → Ubuntu 20.04/22.04/24.04; bullseye/bookworm/trixie → Debian 11/12/12). Wenn der Codename des Hosts nicht mit einer bekannten Upstream-Version übereinstimmt, beendet sich „--install“ mit derselben Anleitung zur manuellen Installation, wie oben beschrieben.

Docker nicht installiert: --check-only meldet „MISSING: Docker ist nicht installiert“ und gibt den genauen Befehl zur erneuten Ausführung aus, der für die erkannte Distributionsfamilie geeignet ist. Der Standardpfad von --install installiert Docker (docker.io / moby-engine / docker-ce / docker, je nach Familie), aktiviert und startet den Daemon, konfiguriert die NVIDIA-Laufzeitumgebung und fügt den aufrufenden Benutzer zur Gruppe „docker“ hinzu. Wenn Sie Docker lieber selbst verwalten möchten, installieren Sie es vor der erneuten Ausführung des Skripts oder übergeben Sie --skip-docker-install.

Docker ist installiert, aber für „docker run“ ist weiterhin „sudo“ erforderlich: Das Skript fügt den aufrufenden Benutzer zur Gruppe „docker“ hinzu, doch Linux aktualisiert die Gruppenzugehörigkeit erst bei einer neuen Anmeldesitzung. Melden Sie sich ab und wieder an oder führen Sie in jeder neuen Shell„newgrp docker“ aus, bis die neue Zugehörigkeit aktiv ist.

Docker-Laufzeitumgebung fehlt weiterhin: Starten Sie Docker neu und führen Sie dann „nvidia-ctk runtime configure --runtime=docker“ erneut aus.

Erkannter Treiberzweig != 580: Der Treiberzweig-Pin ist bei der Debian-Familie (nvidia-open-580) exakt festgelegt. In der rhel-/suse-Familie installiert das Skript den neuesten offenen Treiber, der im CUDA 13.0-Repo von NVIDIA für die erkannte Distribution bereitgestellt wird und immer ≥ 580 ist. Wenn Ihr Host einen strengeren Pin benötigt, setzen Sie $NVIDIA_DRIVER_PACKAGE_RHEL / $NVIDIA_DRIVER_KMOD_RHEL / $NVIDIA_DRIVER_PACKAGE_SUSE auf die genauen Paketnamen, die Sie wünschen, bevor Sie --install ausführen.

Treiber ist installiert, aber nvidia-smi schlägt fehl: Laden Sie das Modul mit `sudo modprobe nvidia ` oder starten Sie das System neu. Bei Systemen, auf denen Secure Boot aktiviert ist, kann eine MOK-Registrierung erforderlich sein.

Kubernetes verfügt weiterhin über keine GPU-Kapazität: Vergewissern Sie sich, dass der Treiber auf jedem GPU- Knoten mit „nvidia-smi“ funktioniert, und überprüfen Sie anschließend die Pods des GPU-Operators bzw. des Geräte-Plugins sowie die Knoten- Labels.

Auf GitHub ansehen
---
name: tao-setup-nvidia-gpu-host
description: Checks and installs NVIDIA driver, CUDA Toolkit, and NVIDIA Container Toolkit for GPU-accelerated Docker and Kubernetes hosts. Supports multiple Linux distributions with automated install and read-only check modes.
license: Apache-2.0
---

# NVIDIA GPU Host Setup

Use this setup skill before TAO workflows run on the `docker`, `local-docker`,
or `kubernetes` backend. It standardizes the host GPU runtime on:

- NVIDIA driver branch `580` (open kernel module preferred)
- CUDA Toolkit package `cuda-toolkit-13-0`
- NVIDIA Container Toolkit `1.19.0`
- Docker engine — only installed for `docker` / `local-docker` backends and
  only when Docker is missing. The package picked depends on the distro
  family (`docker.io` on Debian-family by default, `moby-engine` /
  `docker-ce` from `download.docker.com` on RHEL-family, `docker` on
  SUSE-family). Pass `--skip-docker-install` to opt out.

The check is safe and read-only by default — it works on any Linux
distribution because it only probes `nvidia-smi`, the CUDA toolkit path,
the installed container-toolkit package version (via `dpkg`/`rpm`/the
`nvidia-ctk` binary version), and the Docker daemon's NVIDIA runtime.

Installation must be explicitly authorized by the user and rerun with
`--install`. The install path is automated for these distro families:

| Family | Tested distros | Manager | Notes |
|---|---|---|---|
| debian | Ubuntu 22.04 / 24.04, Debian 12 (and derivatives Pop!_OS, Mint, Zorin, Raspbian, KDE Neon, etc. via `UBUNTU_CODENAME` / `VERSION_CODENAME`) | `apt-get` | Adds NVIDIA `cuda-keyring` + Container Toolkit `.list`. Docker via `docker.io` (override `$DOCKER_PACKAGE_DEBIAN`). |
| rhel | Fedora 39+, RHEL / Rocky / AlmaLinux 9 and 10 | `dnf` (or `yum`) | Adds NVIDIA `cuda-<distro>.repo` + Container Toolkit `.repo`. Docker via Fedora `moby-engine` when available, otherwise `docker-ce` from `download.docker.com`. |
| suse | openSUSE Leap 15, SLES 15 | `zypper` | Adds the same NVIDIA `.repo` files. Docker via the distribution `docker` package. |
| other (Arch, Alpine, Gentoo, NixOS, FreeBSD, …) | n/a | n/a | `--install` exits with a clear error listing the version targets and the NVIDIA install-guide URLs. Install manually, then rerun `--check-only`. |

## Quick Start

From the skill bank root:

```bash
# Check the local Docker backend host.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --check-only

# Install or repair after user approval.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --install

# Check a Kubernetes GPU worker host.
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend kubernetes --check-only
```

> ⚠️ **Note — running non-interactively (agent/skill runs):** a skill run has no terminal, so the
> installer's `Continue? [y/N]` prompt cannot be answered. After running `--check-only` to preview and
> getting the user's approval, append the assume-yes flag (`--yes`) to the `--install` command so it
> proceeds without a prompt — this auto-confirms installation of system packages (NVIDIA driver, CUDA
> Toolkit, NVIDIA Container Toolkit, and Docker for Docker backends) and modifies the host, so only do
> this on a host you control. A person running `--install` directly at a terminal gets the prompt instead.

## Workflow Contract

Docker and Kubernetes workflows must run the check before submitting GPU work:

```bash
SETUP_SCRIPT="${TAO_SKILL_BANK_ROOT:-$PWD}/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh"

bash "$SETUP_SCRIPT" --backend docker --check-only || {
  echo "MISSING: TAO GPU host runtime is not ready."
  echo "After user approval, run (append --yes for non-interactive agent runs):"
  echo "  bash \"$SETUP_SCRIPT\" --backend docker --install"
  exit 1
}
```

Never install silently. If the check fails, explain what is missing, ask the
user to authorize the fix, then run the install command and rerun the check.

## What The Installer Does

The installer dispatches on the detected distribution family. On every
supported family it adds NVIDIA's CUDA and Container Toolkit repositories
(if missing), installs the pinned runtime packages, optionally installs
Docker, wires the NVIDIA Docker runtime, and adds the invoking user to
the `docker` group.

Common steps (all families):

1. Adds NVIDIA's CUDA repository if missing (apt `cuda-keyring` deb,
   `cuda-<distro>.repo` for dnf/zypper).
2. Adds NVIDIA's Container Toolkit repository if missing (`.list` for apt,
   `.repo` for dnf/zypper).
3. Installs the matching kernel header / devel package for the running
   kernel.
4. Installs the driver branch 580 packages, `cuda-toolkit-13-0`, and the
   Container Toolkit pinned to `1.19.0` (the dpkg-suffixed `1.19.0-1` is
   the same upstream version expressed for apt).
5. For Docker backends and when Docker is missing, installs Docker
   (override / opt-out flags below), enables/starts the daemon, then runs
   `nvidia-ctk runtime configure --runtime=docker` and restarts Docker
   when `systemctl` is available.
6. Adds the invoking user (`$SUDO_USER` if available, else `$USER`) to the
   `docker` group so subsequent shells can run `docker` without `sudo` —
   opt out with `--skip-docker-group`. **The new group membership does not
   take effect in the current shell**: log out and back in, or run
   `newgrp docker` in each new shell.
7. Attempts `modprobe nvidia` so verification can pass before reboot.

Family-specific package selections:

| Step | debian-family | rhel-family | suse-family |
|---|---|---|---|
| Kernel headers | `linux-headers-$(uname -r)` | `kernel-devel-$(uname -r)`, `kernel-headers-$(uname -r)` | `kernel-default-devel` |
| Driver | `nvidia-driver-pinning-580`, `nvidia-open-580` (override: `$NVIDIA_DRIVER_PACKAGE_DEBIAN`) | `nvidia-driver-cuda`, `kmod-nvidia-open-dkms` (override: `$NVIDIA_DRIVER_PACKAGE_RHEL`, `$NVIDIA_DRIVER_KMOD_RHEL`) | `nvidia-open-driver-G06-signed-kmp-default` (override: `$NVIDIA_DRIVER_PACKAGE_SUSE`) |
| CUDA toolkit | `cuda-toolkit-13-0` | `cuda-toolkit-13-0` | `cuda-toolkit-13-0` |
| Container Toolkit | `nvidia-container-toolkit=1.19.0-1` + base/tools/libs | `nvidia-container-toolkit-1.19.0` + base/tools/libs | same as rhel |
| Docker | `docker.io` (override: `$DOCKER_PACKAGE_DEBIAN`) | `moby-engine`+`moby-cli` on Fedora when available, else `docker-ce docker-ce-cli containerd.io` from `download.docker.com` | `docker` |

## Verification

After installation, verify:

```bash
nvidia-smi
/usr/local/cuda-13.0/bin/nvcc --version
docker info --format '{{json .Runtimes}}' | grep nvidia
sudo docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smi
```

Expected `nvidia-smi` output includes driver `580.x` and CUDA Version `13.0`.
Expected `nvcc` output includes `release 13.0`.

## Kubernetes Notes

For self-managed Kubernetes clusters, run the host installer on every GPU
worker node or bake the same package set into the node image before installing
the NVIDIA GPU Operator or device plugin.

The workflow check also warns if `kubectl` is available but the cluster reports
no `nvidia.com/gpu` allocatable capacity. In that case, install/configure the
NVIDIA GPU Operator after the worker host runtime is ready:

```bash
helm repo add nvidia https://helm.ngc.nvidia.com/nvidia
helm repo update
helm install --wait gpu-operator -n gpu-operator --create-namespace nvidia/gpu-operator
```

Managed Kubernetes providers may own driver installation through node images or
GPU Operator policy. Do not overwrite a provider-managed GPU node without user
approval and a rollback plan.

## Failure Modes

**Unsupported distribution family**: `--install` automates debian-, rhel-,
and suse-family hosts. On Arch, Alpine, Gentoo, NixOS, FreeBSD, or anything
without `/etc/os-release` (e.g. macOS), the script exits with a clear error
that lists the four version targets and the upstream NVIDIA install-guide
URLs:

- `https://docs.nvidia.com/cuda/cuda-installation-guide-linux/`
- `https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html`
- `https://docs.docker.com/engine/install/`

Install those four pieces using your distribution's package manager and
rerun the script with `--check-only` to verify. The check is universally
portable — it only queries the binaries / package databases — so once the
runtime is in place the workflow contract is satisfied regardless of the
underlying distro.

**Unsupported Ubuntu/Debian derivative**: When `ID` is e.g. `pop`, `mint`,
`zorin`, `raspbian`, or another debian-family derivative, the script maps
the host onto the upstream Ubuntu/Debian CUDA repo via `UBUNTU_CODENAME` /
`VERSION_CODENAME` (`focal`/`jammy`/`noble` → Ubuntu 20.04/22.04/24.04;
`bullseye`/`bookworm`/`trixie` → Debian 11/12/12). If the host's codename
doesn't match a known upstream release, `--install` exits with the same
manual-install guidance described above.

**Docker not installed**: `--check-only` reports `MISSING: Docker is not
installed` and prints the exact rerun command appropriate to the detected
distro family. The default `--install` path installs Docker (`docker.io` /
`moby-engine` / `docker-ce` / `docker` depending on family), enables/starts
the daemon, configures the NVIDIA runtime, and adds the invoking user to
the `docker` group. If you prefer to manage Docker yourself, install it
before rerunning the script or pass `--skip-docker-install`.

**Docker installed but `docker run` still needs sudo**: The script adds the
invoking user to the `docker` group, but Linux only refreshes group
membership on a new login session. Log out and back in, or run
`newgrp docker` in each new shell, until the new membership is active.

**Docker runtime still missing**: Restart Docker, then rerun
`nvidia-ctk runtime configure --runtime=docker`.

**Driver branch detected != 580**: The driver-branch pin is exact on
debian-family (`nvidia-open-580`). On rhel-/suse-family the script
installs the latest open driver shipped in NVIDIA's CUDA 13.0 repo for
the detected distro, which is always ≥ 580. If your host needs a stricter
pin, set `$NVIDIA_DRIVER_PACKAGE_RHEL` / `$NVIDIA_DRIVER_KMOD_RHEL` /
`$NVIDIA_DRIVER_PACKAGE_SUSE` to the exact package names you want before
running `--install`.

**Driver installed but `nvidia-smi` fails**: Load the module with
`sudo modprobe nvidia` or reboot. Secure Boot may require MOK enrollment on
systems where it is enabled.

**Kubernetes still has no GPU capacity**: Confirm the driver works on each GPU
node with `nvidia-smi`, then check the GPU Operator/device plugin pods and node
labels.

tao-setup-nvidia-gpu-host installieren

Laden Sie die Skill-Dateien herunter und entpacken Sie sie in Ihr Verzeichnis „.claude/skills/“.

ZIP herunterladen

Klonen Sie das Repository und kopieren Sie die Skill-Dateien in Ihr Projekt.

git clone https://github.com/NVIDIA/skills/tree/main/skills/tao-setup-nvidia-gpu-host # Copy SKILL.md to your .claude/skills/ directory

Kopieren Kopieren
Schnelle Einrichtung: Kopieren Sie den Skill-Ordner nach .claude/skills/ Claude erkennt den Skill automatisch und nutzt ihn.
Repository NVIDIA/skills

Ähnliche Skills

klingai-upgrade-migration
Zeit aktualisiert 3. Juli 2026
Verification &amp; Quality Assurance
Zeit aktualisiert 29. Juni 2026
base44-cli
Zeit aktualisiert 29. Juni 2026
Railway CLI Management
Zeit aktualisiert 2. Juli 2026
OR