Inferenz
Inferenz ist die Nutzung eines fertig trainierten KI-Modells: Es verarbeitet eine Eingabe und liefert eine Ausgabe — im Unterschied zum Training.
Kurz gesagt: Training ist das Lernen des Modells, Inferenz ist die spätere Anwendung. Jede Frage an ChatGPT ist ein Inferenz-Vorgang.
Der Unterschied zum Training
Beim Training lernt das Modell aus Daten und passt seine Parameter an — das ist einmalig, teuer und rechenintensiv. Bei der Inferenz stehen die Parameter fest; das Modell rechnet nur noch die Antwort aus.
Warum Inferenz Geld kostet
Jede Anfrage verbraucht Rechenzeit. Bei Sprachmodellen wird meist nach verarbeiteten Tokens abgerechnet, was den laufenden Betrieb bestimmt.