Live APM-Bench: Neuer Benchmark für persistente Erinnerung in Video-Assistants
↘

AsyncLLM: Open-Source-Framework macht LLMs zu gleichzeitig handelnden Agenten

Forscher veröffentlichen Framework, das vortrainierte Modelle ohne zusätzliches Training zu asynchronen Agenten macht.

· Veröffentlicht: 30.09.2026 ·3 Min Lesezeit
AsyncLLM: Open-Source-Framework macht LLMs zu gleichzeitig handelnden AgentenMit KI erstellt
◆ Fakten auf einen Blick
  • Das Framework heißt AsyncLLM und ist open-source.
  • Es ermöglicht vortrainierten LLMs, gleichzeitig zu beobachten, zu denken und zu handeln, ohne zusätzliches Training.
  • Die Kernidee: Concurrency lebt innerhalb der Inferenz, nicht um API-Aufrufe herum.
  • Ein Agent ist eine Menge von Python async/await Coroutinen.
  • Jede Coroutine schreibt in Cache-Blöcke und wählt über Cache-Views, welche Blöcke sie beachtet.
  • Streams lesen den sich entwickelnden Zustand anderer, auch wenn sie unvollständig sind.

AsyncLLM: LLMs als gleichzeitig handelnde Agenten

Das neue Forschungsframework AsyncLLM definiert große Sprachmodelle als generelle asynchrone Agenten, die gleichzeitig beobachten, denken und handeln können – ohne zusätzliches Training. Die Entwickler veröffentlichen das Framework als Open Source. Die Kernidee: Concurrency lebt innerhalb der Inferenz und nicht um API-Aufrufe herum. Warum dieser Ansatz? Viele reale Anwendungsfälle sind nicht sequenziell: Sprachassistenten, verkörperte Agenten und Überwachungssysteme erhalten neue Eingaben, während sie noch über eine andere Aufgabe nachdenken oder eine Aktion ausführen. Bisherige Lösungen nutzen spezialisierte Architekturen für Sprachinteraktion, Videostreams, Robotersteuerung oder asynchrones Tool-Calling. AsyncLLM verallgemeinert diese Ansätze zu einem allgemeinen asynchronen Agenten, der sich an verschiedene Arten von Nebenläufigkeit anpassen kann. Dazu wird die Concurrency direkt in den Inferenzprozess verlagert: Anstatt auf den Abschluss eines API-Aufrufs zu warten, kann der Agent während des Denkens neue Eingaben verarbeiten und parallel weitere Schritte planen. Ein Agent ist dabei eine Menge von Python async/await Coroutinen. Jede Coroutine schreibt in Cache-Blöcke und wählt über Cache-Views aus, welche Blöcke sie beachtet. Streams lesen den sich entwickelnden Zustand anderer, auch wenn diese noch unvollständig sind. Das Zusammenwirken der Coroutinen ermöglicht die Agenten-Funktionalität: Verschiedene Coroutinen übernehmen Teilaufgaben wie Beobachtung, Planung oder Aktion. Sie kommunizieren über gemeinsame Cache-Blöcke, in die sie Zwischenergebnisse schreiben und aus denen sie die für sie relevanten Informationen auswählen. Dadurch können Beobachtung, Denken und Handeln gleichzeitig ablaufen: Eine Coroutine kann neue Sensordaten in einen Cache-Block schreiben, während eine andere bereits auf Basis eines früheren, noch unvollständigen Zustands eine Entscheidung trifft. Das Framework lässt Benutzer oder die Agenten selbst Inferenz-Coroutinen mit überlappenden Speicherzuständen definieren. Gezeigt wird, dass Qwen 3.x Modelle asynchron für Streaming-Video-Verständnis, Videospiele und Überwachung funktionieren – ohne task-spezifisches Training.

Unabhängige Benchmarks zeigen Schwächen asynchroner Agenten

Unabhängige Benchmarks zeichnen ein gemischtes Bild für asynchrone LLM-Agenten. Im Robotouille-Benchmark erreicht ReAct mit GPT-4o nur 11 Prozent bei asynchronen Aufgaben, während es bei synchronen Aufgaben 47 Prozent sind. Die Analyse zeigt, dass LLM-Agenten Schwierigkeiten haben, langfristiges Feedback zu integrieren und ihr Denken während der Ausführung selbst zu überprüfen. Der AsyncTool-Benchmark zeigt bei verzögertem Tool-Feedback einen deutlichen Leistungsabfall aktueller Agenten. Warum erschwert verzögertes Feedback die Koordination? Wenn ein Agent ein Tool aufruft und auf dessen Antwort warten muss, entsteht eine zeitliche Lücke. In dieser Zeit kann der Agent entweder untätig bleiben – was die Effizienz senkt – oder andere Aufgaben bearbeiten. Wechselt er zu einer anderen Aufgabe, muss er später den Kontext wiederherstellen und die Abhängigkeiten zwischen den Aufgaben korrekt berücksichtigen. Verzögertes Feedback führt dazu, dass der Agent Entscheidungen auf Basis unvollständiger Informationen treffen muss, was zu Fehlern bei der Aufgabenumschaltung und der Verwaltung von Abhängigkeiten führen kann. Modelle, die Aufgabenumschaltung und Abhängigkeiten besser koordinieren, schneiden in AsyncTool besser ab. Wichtig zur Einordnung: Diese Benchmarks testen andere Modelle und Architekturen – etwa ReAct mit GPT-4o – und nicht das AsyncLLM-Framework mit Qwen 3.x. Ob die speziellen Mechanismen von AsyncLLM wie Cache-Blöcke und Coroutinen diese Schwächen beheben, ist eine offene Frage und wird in diesen Evaluierungen nicht beantwortet.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel