Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Vision-Language-Modell

Modell, das Bild und Sprache gemeinsam versteht.

Aktualisiert: 12.07.2026

Ein Vision-Language-Modell verarbeitet Bilder und Text gemeinsam und kann so Fragen zu Bildern beantworten, sie beschreiben oder Diagramme auswerten. Solche Modelle verbinden Bildverstehen mit Sprachfähigkeit und sind ein wichtiger Baustein multimodaler Assistenten.