Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Policy-Gradient

Direktes Optimieren der Handlungsstrategie.

Aktualisiert: 12.07.2026

Policy-Gradient-Verfahren verbessern beim bestärkenden Lernen unmittelbar die Strategie eines Agenten, indem sie Handlungen, die zu hoher Belohnung führen, wahrscheinlicher machen. Sie eignen sich besonders für Aufgaben mit vielen oder kontinuierlichen Handlungsmöglichkeiten.