Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Belohnungsmodell

Modell, das Antworten eine Belohnung zuweist.

Aktualisiert: 12.07.2026

Ein Belohnungsmodell lernt aus menschlichen Bewertungen, wie gut eine Antwort ist, und liefert daraus ein Zahlensignal. Beim RLHF dient es als Ersatz für laufende menschliche Bewertung, an dem sich das Sprachmodell ausrichtet. Seine Qualität entscheidet stark über das Ergebnis der Ausrichtung.