Live ChatGPT Voice steuert jetzt den Work-Bereich

NVIDIA veröffentlicht NVCRE: Open-Source-Controller zertifiziert GPU-Cluster vor Produktionsstart

Der Kubernetes-Controller führt echte Trainings- und Kommunikations-Workloads aus, misst Leistung und meldet fehlerhafte Knoten mit Begründung.

· Veröffentlicht: 24.09.2026 ·3 Min Lesezeit
NVIDIA veröffentlicht NVCRE: Open-Source-Controller zertifiziert GPU-Cluster vor ProduktionsstartMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • NVCRE ist ein Kubernetes-Controller, der GPU-Cluster zertifiziert, bevor Produktions-Workloads darauf laufen.
  • NVCRE führt echte Trainings- und Kommunikations-Workloads über topologiebewusste Knotengruppen aus, misst die Leistung, erkennt Hardwarefehler und meldet jeden fehlerhaften Knoten mit Begründung.
  • NVCRE verändert keine Knoten (kein Cordon/Taint); die Quarantäne fehlerhafter Knoten bleibt der Plattform überlassen.
  • Zielgruppe sind Plattform- und Infrastrukturteams, die GPU-Cluster aufbauen, validieren oder weiterverkaufen.
  • Der Funktionsumfang umfasst u.a. einen Zertifizierungskatalog mit NCCL-Kommunikationstests und Multi-Node-Trainings-Workloads, Plattform-Erkennung (AWS, GCP, Azure, OCI, nscale, TogetherAI, Mistral, Forge, on-prem), GPU-Architektur-Erkennung (GB200, GB300, H100, H200, B200, A100, L40S, L40), Goodput-Messung, Per-Bus-Bandbreitenmessung, Node-Health-Monitoring mit CEL-Ausdrücken, Topologie-bewusste Gruppierung, Checkpoint-Restart, WorkloadRun-Ressource und nvcrectl-CLI.
  • Die APIs setzen sich ähnlich wie Deployment, ReplicaSet und Pod zusammen: Certification, Workflow, WorkloadRun.

NVCRE veröffentlicht: Kubernetes-Controller zertifiziert GPU-Cluster mit echten Workloads

NVIDIA hat mit der Cluster Readiness Engine (NVCRE) einen Open-Source-Kubernetes-Controller veröffentlicht, der GPU-Cluster vor dem Start von KI-Produktionsworkloads zertifiziert. Das Werkzeug führt echte verteilte Trainings- und Kommunikations-Workloads über topologiebewusste Knotengruppen aus, misst die Leistung, erkennt Hardwarefehler und meldet jeden fehlerhaften Knoten mit einer Begründung. Die erste Version v0.1.0 wurde laut vcluster.com am 1. September 2026 freigegeben. NVCRE richtet sich an Plattform- und Infrastrukturteams, die GPU-Cluster aufbauen, validieren oder weiterverkaufen. Der Controller verändert keine Knoten: Er cordoned oder taintet sie nicht, sondern überlässt die Quarantäne fehlerhafter Knoten der Plattform. Damit schließt NVCRE eine Lücke, die bestehende NVIDIA-Werkzeuge wie GPU Operator, DCGM oder Cluster Toolkit offen lassen: Sie decken Teilaspekte ab, bieten aber keine automatisierte Zertifizierung durch echte Workloads vor dem Produktionsstart.

Zertifizierungskatalog und Topologie-Erkennung: So prüft NVCRE die Hardware

Der Funktionsumfang von NVCRE umfasst einen Zertifizierungskatalog mit NCCL-Kommunikationstests und Multi-Node-Trainings-Workloads. In Version 0.1.0 sind NCCL all-reduce, all-gather und all-to-all über mehrere Knoten enthalten, außerdem Single-Node-NCCL-Loopback, NVSwitch-Loopback, DCGM-Level-4-Diagnose sowie Trainingsläufe mit Nemotron-5-8B und 56B. NVCRE erkennt die GPU-Architektur anhand des Labels nvidia.com/gpu.product und die Plattform anhand der Node-providerID. Darauf aufbauend wendet es Katalog-Overrides an, etwa EFA auf AWS, TCPXO oder RoCE auf GCP und InfiniBand auf Azure. Während der Läufe misst der Controller den Goodput aus Trainingslogs und die Per-Bus-Bandbreite aus NCCL-Logs. Die Node-Health-Überwachung erfolgt mit CEL-Ausdrücken, die während der Workload-Ausführung ausgewertet werden. Die APIs setzen sich ähnlich wie Deployment, ReplicaSet und Pod zusammen: Certification, Workflow und WorkloadRun. NVCRE verändert keine Knoten – es cordoned oder taintet sie nicht, sondern meldet nur Fehler mit Begründung.

Installation und Abhängigkeiten: Was Plattformteams bereitstellen müssen

Die Installation von NVCRE erfolgt über die CLI nvcrectl mit dem Befehl setup init. Dieser läuft in zwei Phasen ab: In der Phase deps wird Kubeflow Trainer installiert, der für TrainJob-Workloads benötigt wird. In der Phase helm wird das NVCRE-Helm-Chart eingespielt, das CRDs, Controller-Deployment, RBAC, Metrics Service beziehungsweise ServiceMonitor und eingebaute LogProfiles enthält. Voraussetzung ist ein bereits installierter NVIDIA GPU Operator. Für die Standard-Metriken werden außerdem Prometheus-Operator-CRDs benötigt; für Katalogeinträge der Architekturen GB200 und GB300 ist der NVIDIA-DRA-Treiber mit ComputeDomain-Ressourcen erforderlich. Die Kategorie diagnostics/dcgm-level4 setzt zusätzlich einen eigenständigen DCGM-Dienst voraus, den der GPU Operator erzeugt. NVCRE kann nicht auf Nicht-NVIDIA-GPUs ausgeführt werden, da es auf NVIDIA-spezifische Signale wie nvidia.com/gpu.product-Labels, DCGM-Diagnose und NVLink-Topologie angewiesen ist. Eigene Trainings-Workloads lassen sich statt des Katalogs verwenden, indem Workflow- oder Job-Ressourcen direkt mit beliebiger Workload-Spec erstellt werden.

Einsatzempfehlung und Grenzen: Burn-in alle 3–4 Wochen, keine Quarantäne

NVCRE ist für Plattform- und Infrastrukturteams gedacht, die neu aufgebaute, aufgerüstete oder weiterverkaufte GPU-Cluster vor der Übergabe an Produktionsworkloads zertifizieren möchten. Der praktische Nutzen liegt in der Automatisierung der Validierung: Statt manueller Fehlersuche durch Node-Bisecting führt der Controller reproduzierbare Läufe durch und liefert Berichte über die Eignung des Clusters. Empfohlen wird ein wiederkehrender Cluster-weiter Burn-in alle drei bis vier Wochen mit echten ML-Trainings-Workloads, um Frühausfälle und Hardware-Degradation zu erkennen. Synthetische Benchmarks allein reichen nicht, da Fehler wie NVLink-Bandbreitenverlust oder NCCL-Collective-Hänger erst unter anhaltender verteilter Last auftreten. Die Quarantäne fehlerhafter Knoten bleibt der Plattform überlassen: NVCRE cordoned oder taintet keine Knoten. Gegenüber bestehenden Werkzeugen wie GPU Operator oder DCGM füllt NVCRE eine Lücke, weil diese keine automatisierte Zertifizierung durch echte Workloads vor dem Produktionsstart bieten.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel