Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Multimodale Grundmodelle

Große Modelle für mehrere Datenarten zugleich.

Aktualisiert: 12.07.2026

Multimodale Grundmodelle sind große, breit vortrainierte Modelle, die Text, Bild, Ton und teils Video gemeinsam verarbeiten. Sie bilden die Grundlage vielseitiger Assistenten, die etwa ein Foto beschreiben, aus einer Grafik lesen oder auf gesprochene Sprache reagieren können.