Live ChatGPT verweigert Tool-Calls für app-only MCP-Tools

Forschung

Neue Modelle, Papers und Durchbrüche aus der KI-Forschung.

Günstige und teure LLMs kombiniert: Neues Verfahren mit GenauigkeitsgarantieMit KI erstellt
Forschung

Günstige und teure LLMs kombiniert: Neues Verfahren mit Genauigkeitsgarantie

Ein Blogbeitrag auf dev.to beschreibt ein Verfahren namens Model Cascade, das Klassifizierungsaufgaben mit großen Sprachmodellen kostengünstiger machen soll, indem ein günstiges Proxy-Modell und ein teures Oracle-Modell kombiniert werden. Eine konkrete Implementierung mit ähnlichem Konzept namens BA

24.08.2026
NVIDIA-Agent AVO erreicht perfekten ARC-AGI-3-ScoreMit KI erstellt
Forschung

NVIDIA-Agent AVO erreicht perfekten ARC-AGI-3-Score

Unternehmen meldet 100 Prozent im interaktiven Reasoning-Benchmark – Architektur statt nur Modell im Fokus

23.08.2026
Aggregierte Sicherheits-Scores für KI-Sprachmodelle sind irreführendMit KI erstellt
Forschung

Aggregierte Sicherheits-Scores für KI-Sprachmodelle sind irreführend

Studie zeigt: Pauschales Blockieren verzerrt Bewertungen, kurze Tests reichen aus

23.08.2026
R-Tuning: Fehlendes 'I don't know' als Halluzinationsursache – Widerspruch zu OpenAIMit KI erstellt
Forschung

R-Tuning: Fehlendes 'I don't know' als Halluzinationsursache – Widerspruch zu OpenAI

Ein Paper sieht fehlendes 'I don't know' als Ursache, OpenAI beansprucht die Fähigkeit bereits.

23.08.2026
Einfache Muster, Orchestrator-Worker und Benchmarks: Drei Wege zu zuverlässigen Multi-Agenten-SystemenMit KI erstellt
Forschung

Einfache Muster, Orchestrator-Worker und Benchmarks: Drei Wege zu zuverlässigen Multi-Agenten-Systemen

Produktionserprobte Muster, Anthropics Orchestrator-Worker-Architektur und ein Benchmark zu vier Orchestrierungsansätzen – mit einer Debatte über Einfachheit versus Frameworks.

23.08.2026
ChatGPT: Prompt-Navigator und Conversation-Search weiterhin fehlerhaftMit KI erstellt
Forschung

ChatGPT: Prompt-Navigator und Conversation-Search weiterhin fehlerhaft

Nutzer melden zwei getrennte Probleme in ChatGPT und ChatGPT Business.

22.08.2026
NARU: Neues japanisches Langform-Video-Benchmark für narrative Entwicklung und kulturelles ReasoningMit KI erstellt
Forschung

NARU: Neues japanisches Langform-Video-Benchmark für narrative Entwicklung und kulturelles Reasoning

Hierarchische Annotations-Pipeline und Muttersprachler-Verifikation sollen Modelle testen

22.08.2026
Working Draft 'SELF-ANALYZE' für ChatGPT vorgestelltMit KI erstellt
Forschung

Working Draft 'SELF-ANALYZE' für ChatGPT vorgestellt

Fallbasierte Zuverlässigkeitsbewertung als Alternative zu Raten oder Blockieren

22.08.2026
Nutzer melden wiederkehrendes Zellmuster in GPT-Image-2-BildernMit KI erstellt
Forschung

Nutzer melden wiederkehrendes Zellmuster in GPT-Image-2-Bildern

Community-Berichte deuten auf ein systematisches Artefakt hin, das nicht von allen Nutzern wahrgenommen wird.

21.08.2026
AdaPop: Unlearning-Methode passt Gradientendruck an Faktenpopularität anMit KI erstellt
Forschung

AdaPop: Unlearning-Methode passt Gradientendruck an Faktenpopularität an

Neue Methode soll beliebte Fakten besser vergessen und die Forget-Retain-Balance automatisieren; Code ist öffentlich verfügbar.

20.08.2026
SkillGate: Neues Verfahren für In-Policy-Skill-Auswahl in Langzeithorizont-AgentenMit KI erstellt
Forschung

SkillGate: Neues Verfahren für In-Policy-Skill-Auswahl in Langzeithorizont-Agenten

Getrennte Kreditvergabe für Skill-Namens- und Ausführungs-Token behebt selector credit starvation und verbessert Erfolgsraten

20.08.2026
150M-Modell erreicht neue Kosten-Genauigkeitswerte auf ARC-AGI-1Mit KI erstellt
Forschung

150M-Modell erreicht neue Kosten-Genauigkeitswerte auf ARC-AGI-1

Laut Papers with Code: 150M-Parameter-Modell mit rekurrentem latentem Reasoning und In-Context-Learning erreicht neue Kosten-Genauigkeits-Frontier; LLM-as-a-Verifier führt probabilistische Verifikation ein.

20.08.2026