Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Direct Preference Optimization (DPO)

Trainingsmethode, um Modelle an Vorlieben auszurichten.

Aktualisiert: 11.07.2026

DPO ist ein Verfahren, um ein Sprachmodell direkt anhand von Präferenzdaten auszurichten, also anhand von Beispielen, welche Antwort Menschen jeweils bevorzugen. Es gilt als einfachere Alternative zu klassischem RLHF, weil es ohne separates Belohnungsmodell auskommt, und wird beim Feinschliff moderner Modelle häufig eingesetzt.