Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Forschung

Neue Modelle, Papers und Durchbrüche aus der KI-Forschung.

Fireworks: Open-Source-Kombination übertrifft Claude Opus 4.7 bei Legal-Agent-AufgabenMit KI erstellt
Forschung

Fireworks: Open-Source-Kombination übertrifft Claude Opus 4.7 bei Legal-Agent-Aufgaben

Zwei Systemtechniken mit GLM-5.1 und Kimi K2.6 erzielen höhere All-Pass-Scores auf dem Harvey-Benchmark – zu einem Bruchteil der Kosten.

19.07.2026
DeepSeek-V4: Programmierbare Schleifen statt fester TrainingsrezepteMit KI erstellt
Forschung

DeepSeek-V4: Programmierbare Schleifen statt fester Trainingsrezepte

Wie die Integration von Architektur, Routing und Inferenz in die Trainingsschleife die KI-Entwicklung grundlegend verändert

19.07.2026
Helix: VLA-Modell von Figure faltet jetzt WäscheMit KI erstellt
Forschung

Helix: VLA-Modell von Figure faltet jetzt Wäsche

Vom Logistikzentrum zum Wäschekorb: Helix beweist Vielseitigkeit

19.07.2026
Figure stellt Helix vor: VLA-Modell steuert humanoiden Oberkörper und ermöglicht Multi-Roboter-KollaborationMit KI erstellt
Forschung

Figure stellt Helix vor: VLA-Modell steuert humanoiden Oberkörper und ermöglicht Multi-Roboter-Kollaboration

Helix vereint Wahrnehmung, Sprachverstehen und Steuerung in einem Modell und setzt neue Maßstäbe bei der simultanen Steuerung mehrerer Roboter mit ungesehenen Objekten.

19.07.2026
Fortschritte und Grenzen im Videoverstehen: Offene Modelle im FokusMit KI erstellt
Forschung

Fortschritte und Grenzen im Videoverstehen: Offene Modelle im Fokus

Aktuelle Entwicklungen treiben KI in Richtung realer Anwendungen, doch offene Modelle kämpfen mit Generalisierung, Effizienz und unvollständiger Offenheit.

19.07.2026
Prompt-Caching senkt Input-Kosten um bis zu 90 ProzentMit KI erstellt
Forschung

Prompt-Caching senkt Input-Kosten um bis zu 90 Prozent

Artificial Analysis zeigt: Wiederverwendung von Prompt-Teilen macht lange Kontexte wirtschaftlich – doch die Anbieter unterscheiden sich stark

19.07.2026
Studie stellt Nutzen automatischer Harness-Evolution für LLM-Agenten infrageMit KI erstellt
Forschung

Studie stellt Nutzen automatischer Harness-Evolution für LLM-Agenten infrage

Einfache Task-Level-Suchbaselines erzielen unter gleichem Budget und auf held-out Aufgaben oft bessere Ergebnisse.

19.07.2026
MIT-Methode: Roboter lernen durch Vormachen und ErklärenMit KI erstellt
Forschung

MIT-Methode: Roboter lernen durch Vormachen und Erklären

Show-and-Tell-Ansatz ermöglicht kontextsensitives Verhalten

18.07.2026
FloatForm: MIT zeigt Schwarm autonomer Boote, die sich zu Strukturen verbindenMit KI erstellt
Forschung

FloatForm: MIT zeigt Schwarm autonomer Boote, die sich zu Strukturen verbinden

Die quadratischen Roboter navigieren selbstständig, docken magnetisch an und eröffnen neue Perspektiven für anpassungsfähige Wasserinfrastrukturen.

18.07.2026
BadWAM: Wenn die Kopplung von Aktion und Weltvorhersage trügtMit KI erstellt
Forschung

BadWAM: Wenn die Kopplung von Aktion und Weltvorhersage trügt

Das Forschungspapier 'BadWAM' zeigt, dass die Sicherheitsannahme von World-Action-Modellen (WAMs) – die Kopplung von Aktionsgenerierung und Weltvorhersage – trügerisch ist. Es führt ein Framework ein, um sogenannte World-Action-Drift-Angriffe zu modellieren und zu evaluieren.

17.07.2026
UniVR: Neues KI-System lernt visuelles Denken, Physik und Planung aus DemonstrationenMit KI erstellt
Forschung

UniVR: Neues KI-System lernt visuelles Denken, Physik und Planung aus Demonstrationen

Das System kombiniert visuelles Denken, physikalische Dynamik und Planung und nutzt das Lernverfahren VR-GRPO.

17.07.2026
MultiRef-Compass: Erstes Framework für die Bewertung von Multi-Referenz-Audio-Video-GenerierungMit KI erstellt
Forschung

MultiRef-Compass: Erstes Framework für die Bewertung von Multi-Referenz-Audio-Video-Generierung

Ein neues Evaluationsframework adressiert die Lücke in der Benchmark-Landschaft für multimodale Inhalte, die aus mehreren Referenzen entstehen. Konkrete Metriken und Akteure bleiben vorerst offen.

17.07.2026