Live PhysMat AI: Physik als Grundbaustein für Materialvorhersagen
↘

TGRL: Temperatur-Gruppierung als Explorationssignal für LLMs

Wie Temperature-Grouped Reinforcement Learning Reward-Kontrast per Jensen-Shannon-Divergenz in Token-Credits übersetzt – und wo das Akronym kollidiert.

· Veröffentlicht: 30.09.2026 ·1 Min Lesezeit
TGRL: Temperatur-Gruppierung als Explorationssignal für LLMsMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • TGRL partitioniert für jeden Prompt die Rollout-Gruppe in niedrig- und hochtemperierte Teilmengen und schätzt den Explorationsgewinn über deren Reward-Kontrast.
  • TGRL weist das Gruppen-Signal als Token-Level-Credit über Jensen-Shannon-Divergenz zwischen den temperatur-skalierten Next-Token-Verteilungen zu, die aus denselben Logits stammen.
  • TGRL erreicht nach eigenen Angaben gleichwertige Genauigkeit bis zu 36% schneller als starke RLVR-Baselines, ohne das Rollout-Budget zu erweitern.
  • Über 11 Benchmarks hinweg verbessert TGRL nach eigenen Angaben den Mathe-Durchschnitt über sechs Benchmarks um 1,6% bei 32B, das CodeForces-Rating um 196,7 Punkte, LiveCodeBench Pass@16 um 4,4% und die Erfolgsraten bei ALFWorld/WebShop um 6,3%/4,9%.
  • Der Code ist auf GitHub verfügbar: https://github.com/1229095296/TGRL/tree/
  • GRPO ist eine Variante des Policy-Gradient-Verfahrens für Sprachmodelle.

TGRL: Temperatur-Gruppierung als Explorationssignal

Das Framework Temperature-Grouped Reinforcement Learning (TGRL) baut auf Reinforcement Learning with Verifiable Rewards (RLVR) auf und nutzt temperaturinduzierte Diversität als explizites Trainingssignal. Für jeden Prompt wird die Rollout-Gruppe in niedrig- und hochtemperierte Teilmengen partitioniert. Der Explorationsgewinn wird über den Reward-Kontrast geschätzt: Die Quelle spezifiziert im Abstract keine geschlossene Formel, beschreibt aber eine kontrastive Gegenüberstellung der Rewards beider Teilmengen – üblicherweise als Differenz der durchschnittlichen Rewards operationalisiert. Dieses Gruppen-Signal wird anschließend als Token-Level-Credit zugewiesen, und zwar über die Jensen-Shannon-Divergenz zwischen den temperatur-skalierten Next-Token-Verteilungen, die aus denselben Logits stammen. Die JS-Divergenz ist dafür geeignet, weil sie als symmetrisches, beschränktes Maß zwei Verteilungen robust vergleicht und so den Unterschied zwischen niedrig- und hochtemperierter Sampling-Verteilung direkt in ein Token-spezifisches Signal übersetzt, ohne zusätzliche Rollouts zu erfordern.

Behauptete Geschwindigkeits- und Benchmark-Gewinne

Nach Angaben der Autoren erreicht TGRL gleichwertige Genauigkeit bis zu 36 Prozent schneller als starke RLVR-Baselines, ohne das Rollout-Budget zu erweitern. Die Beschleunigung wird laut Quelle durch Wall-Clock-Analysen bestätigt, also anhand der realen Trainingszeit bis zur Zielgenauigkeit gemessen. Über elf Benchmarks hinweg verbessert TGRL die Ergebnisse: Der Durchschnitt über sechs Mathe-Benchmarks steigt bei einem 32B-Modell um 1,6 Prozentpunkte, das CodeForces-Rating um 196,7 Punkte, LiveCodeBench Pass@16 um 4,4 Prozentpunkte und die Erfolgsraten bei ALFWorld beziehungsweise WebShop um 6,3 beziehungsweise 4,9 Prozentpunkte. Der Code ist auf GitHub verfügbar.

Akronym-Kollision: TGRL mehrfach vergeben

Die Abkürzung TGRL ist mehrfach vergeben, was die Quellenlage verunreinigt. Neben Temperature-Grouped Reinforcement Learning steht TGRL auch für Trajectory-Guided Reinforcement Learning, Teacher Guided Reinforcement Learning und Temporal Graph Representation Learning. Suchanfragen liefern daher Ergebnisse zu unterschiedlichen Methoden; für die Einordnung des neuen Frameworks ist eine genaue Prüfung der jeweiligen Quelle erforderlich.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel