Live KI-Rechenzentren gefährden Klimaziele – und treiben zugleich saubere Energie voran
↘

AWS dokumentiert erstmals SkyRL auf SageMaker HyperPod

Full-Stack-RL für LLM-Agenten trifft auf resiliente Cloud-Infrastruktur – mit messbaren SWE-Bench-Gewinnen und asynchronem Training für Praktiker.

· Veröffentlicht: 25.09.2026 ·4 Min Lesezeit
AWS dokumentiert erstmals SkyRL auf SageMaker HyperPodMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • SkyRL ist eine full-stack RL-Bibliothek für das Training von LLMs, entwickelt am Berkeley Sky Computing Lab in Zusammenarbeit mit Anyscale, mit Compute-Unterstützung von Anyscale, Databricks, NVIDIA, Lambda Labs und AMD.
  • SkyRL besteht aus den Komponenten skyrl (unified library), skyrl-train, skyrl-tx, skyrl-agent und skyrl-gym.
  • SkyRL unterstützt das Training von Multi-Turn-Tool-Use-LLMs und ist für langhorizontige, reale Umgebungsaufgaben wie SWE-Bench optimiert.
  • SkyRL erzielt auf SWE-Bench-Verified folgende Verbesserungen: SkyRL-Agent-7B-v0 von 11,0 % auf 14,6 %, SkyRL-Agent-8B-v0 von 3,6 % auf 9,4 %, SkyRL-Agent-14B-v0 von 18,0 % auf 21,6 %.
  • SkyRL baut auf VeRL und OpenHands auf.
  • Amazon SageMaker HyperPod bietet Cluster-Resilienz, überwacht kontinuierlich den Node-Zustand, ersetzt fehlerhafte Nodes automatisch und ermöglicht Checkpointing, sodass Trainingsjobs nach Hardwareausfällen vom letzten gespeicherten Schritt fortgesetzt werden können.

AWS dokumentiert erstmals SkyRL auf SageMaker HyperPod

AWS hat einen Blogpost mit dem Titel „Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod“ veröffentlicht. Der Beitrag beschreibt, wie sich die Open-Source-RL-Bibliothek SkyRL auf SageMaker HyperPod für multimodales RL-Training skalieren lässt. Im Mittelpunkt steht die Kombination mit Ray: Nutzer können Ray-Cluster aus SageMaker Studio erstellen, Trainingsjobs remote über sichere Verbindungen einreichen und den Fortschritt über vorkonfigurierte Amazon Managed Grafana Dashboards verfolgen, die das HyperPod Observability EKS Add-on bereitstellt. AWS ordnet RL-Post-Training als zunehmenden Standard beim Bau von Sprachmodell-Agenten ein und verweist auf die Notwendigkeit persistenter Cluster für lange, mehrknotige RL-Läufe. Der Blogpost ist die erste dokumentierte Anleitung zur Nutzung von SkyRL auf HyperPod: Er zeigt konkret, wie die Bibliothek auf der verwalteten Infrastruktur betrieben wird, und schließt damit eine Lücke zwischen der SkyRL-Dokumentation und der AWS-Infrastrukturpraxis.

SkyRL: Full-Stack-RL für LLM-Agenten mit messbaren SWE-Bench-Gewinnen

SkyRL ist eine Full-Stack-RL-Bibliothek für das Training von Large Language Models, entwickelt am Berkeley Sky Computing Lab in Zusammenarbeit mit Anyscale. Compute-Unterstützung kommt von Anyscale, Databricks, NVIDIA, Lambda Labs und AMD – diese Partner stellen die nötige GPU-Infrastruktur bereit, um RL-Trainingsläufe über lange Zeiträume und viele Knoten hinweg durchzuführen. Die Bibliothek besteht aus fünf Komponenten, die jeweils eine klar umrissene Aufgabe erfüllen: skyrl ist die vereinheitlichte Bibliothek für RL auf eigener Hardware und unterstützt die Tinker API, sodass bestehende Trainingsskripte ohne Codeänderungen übernommen werden können. skyrl-train ist das modulare, performante Trainings-Framework, das die eigentliche RL-Optimierung übernimmt. skyrl-tx ist eine plattformübergreifende Bibliothek, die ein Backend für die Tinker API implementiert und eine einheitliche Engine für Training und Inferenz bereitstellt – damit entfällt die Notwendigkeit, zwischen Trainings- und Inferenzumgebung zu wechseln. skyrl-agent ist die Agentenschicht für langhorizontige, reale Aufgaben und optimiert Multi-Turn-Tool-Use-Pipelines. skyrl-gym schließlich ist ein Gymnasium für Tool-Use-Aufgaben mit Umgebungen für Mathematik, Coding, Suche und SQL, implementiert in der Gymnasium-API. SkyRL baut auf VeRL und OpenHands auf und ist auf Multi-Turn-Tool-Use-LLMs sowie langhorizontige Umgebungsaufgaben wie SWE-Bench optimiert. Auf SWE-Bench-Verified erzielt SkyRL mit rund 300 Trainingsbeispielen messbare Verbesserungen: SkyRL-Agent-7B-v0 steigt von 11,0 auf 14,6 Prozent, SkyRL-Agent-8B-v0 von 3,6 auf 9,4 Prozent und SkyRL-Agent-14B-v0 von 18,0 auf 21,6 Prozent. Die Ausgangsmodelle sind OpenHands-7B-Agent, Qwen3-8B ohne Thinking sowie Qwen3-14B mit Thinking.

HyperPod: Resiliente Infrastruktur für großskaliges RL-Training

Amazon SageMaker HyperPod stellt die Infrastruktur für großskalige ML-Workloads auf Amazon EKS bereit. Kernmerkmal ist die Cluster-Resilienz: HyperPod überwacht kontinuierlich den Zustand der Nodes und ersetzt fehlerhafte Knoten automatisch, sodass ein Hardwareausfall nicht den gesamten Cluster lahmlegt. Zusammen mit Checkpointing kann ein Trainingsjob vom zuletzt gespeicherten Schritt fortgesetzt werden, statt von vorn zu beginnen. Das ist für lange, mehrknotige RL-Läufe relevant, bei denen ein einzelner Hardwarefehler sonst Stunden an Rollout-Fortschritt kosten würde. Die Integration mit Ray erweitert die Nutzbarkeit: Ray-Cluster lassen sich direkt aus SageMaker Studio erstellen, Jobs werden remote über sichere Verbindungen eingereicht, und das Training wird über vorkonfigurierte Amazon Managed Grafana Dashboards überwacht. Diese Dashboards werden durch das HyperPod Observability EKS Add-on bereitgestellt. Damit kombiniert HyperPod Ausfallsicherheit mit Beobachtbarkeit für RL-Trainingsläufe, die über viele GPUs und lange Zeiträume laufen.

RL-Post-Training wird Standard: SkyRL im Kontext offener Rezepte

Laut AWS wird RL-Post-Training zunehmend zum Standard beim Bau von Sprachmodell-Agenten. Der Grund liegt in der veränderten Trainingslogik: Modelle lernen dabei, über Sequenzen von Schritten zu denken und zu handeln, indem sie Trajektorien erzeugen, Belohnungen erhalten und ihre Policy anhand der Ergebnisse aktualisieren. Dieser Ansatz geht über klassisches Fine-Tuning hinaus, weil er das Modell nicht nur auf statische Beispieldaten anpasst, sondern es aktiv mit Umgebungsfeedback konfrontiert – ein entscheidender Vorteil für agentische Aufgaben, bei denen Modelle mehrere Werkzeuge aufrufen, Tests ausführen und auf Rückmeldungen reagieren müssen. HyperPod liefert dafür die persistente Cluster-Infrastruktur auf Amazon EKS, die lange, mehrknotige RL-Läufe ohne Fortschrittsverlust ermöglicht. Die SkyRL-Integration reiht sich in einen breiteren Trend offener Post-Training-Ansätze ein: Parallel dazu wurde ein offenes Post-Training-Rezept für GLM-4.5-Air-Base (Rufus-Air) veröffentlicht. Solche offenen Rezepte machen nachvollziehbar, wie aus Basismodellen agentenfähige Systeme entstehen, und senken die Hürde für eigene RL-Läufe. SkyRL auf HyperPod verbindet diesen offenen Ansatz mit verwalteter Cloud-Infrastruktur, die für lange Trainingsjobs ausgelegt ist.

SkyRL-Dokumentation und asynchrones Training: Weitere Details für Praktiker

Die SkyRL-Dokumentation deckt Installation, Quick Start, Systemübersicht, Tinker-Integration, asynchrones Training, Tool-Nutzung, Megatron-Backend, Multi-Turn-Text2SQL, Suche, Konfiguration, Algorithmen wie DAPO und Rezepte ab. Die Architekturdiagramme zeigen die Kernkomponenten von SkyRL-v0.1 sowie die flexible Modellplatzierung: Trainer und Generator können entweder colocated auf denselben GPUs betrieben werden – was den Synchronisationsaufwand minimiert – oder über heterogene Hardware disaggregiert werden, sodass Trainings- und Inferenz-Workloads auf unterschiedlichen Beschleunigertypen laufen können. Weitere Diagramme veranschaulichen asynchrone Rollout-Generierung und asynchrones Off-by-one-Pipelining. Der Geschwindigkeitsvorteil entsteht dadurch, dass Rollouts bereits mit der vorherigen Policy-Version erzeugt werden, während der Trainer parallel die aktuelle Policy aktualisiert – so entstehen keine Wartezeiten zwischen Rollout-Generierung und Trainingsschritt. Für eine Multi-Turn-Text2SQL-Aufgabe und eine Mathematikaufgabe werden konkrete Geschwindigkeitsgewinne ausgewiesen. Am 1. September 2026 wurde zudem ein End-to-End-Rezept für langhorizontige Wissensarbeit auf dem APEX-Agents-Datensatz in Zusammenarbeit mit Mercor veröffentlicht. Damit erhalten Praktiker nicht nur die Bibliothek, sondern auch dokumentierte Wege, um eigene RL-Trainings für Tool-Use-Agenten aufzusetzen und auf HyperPod zu skalieren.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel