Live Microsoft streicht Copilot+ PC-Label bei neuen Surface-Geräten
↘

SciUniverse-Benchmark: Kein Modell schafft die Hälfte der Laboraufgaben

C5R veröffentlicht Testergebnisse aus Facility-0: Pass@1-Raten der sechs Modelle liegen zwischen 9,4 und 45,3 Prozent

· Veröffentlicht: 25.09.2026 ·5 Min Lesezeit
SciUniverse-Benchmark: Kein Modell schafft die Hälfte der LaboraufgabenMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • C5R hat Facility-0 gebaut, ein modellgesteuertes Forschungslabor für Biologie, Chemie und Materialwissenschaften
  • Facility-0 wurde in 12 Wochen aufgebaut
  • Die Software von Facility-0 steuert und überwacht Instrumente von hydraulischen Pressen bis zu einzelnen Pipetten
  • Modelle können in Facility-0 Inventar erkunden, Spezifikationen lesen, Experimente als Code entwerfen, Anweisungen an Geräte und Menschen senden, Messungen analysieren und neu planen
  • SciUniverse ist ein Benchmark, der prüft, ob Modelle wissenschaftliche Ziele in verifizierbare Ergebnisse in Chemie, Biologie und Materialwissenschaften umsetzen können
  • SciUniverse Level 1 umfasst 92 Aufgaben aus Probenvorbereitung, Instrumentensteuerung, Protokollanpassung, experimentübergreifendem Lernen, Facility-Management und Dateninterpretation

Sechs Frontier-Modelle scheitern mehrheitlich an Laboraufgaben

Das US-Startup C5R hat sechs aktuelle Sprachmodelle in einer physischen Laborumgebung getestet. Die Ergebnisse zeigen, dass kein Modell die Hälfte der Aufgaben beim ersten Versuch löste. Der Spitzenreiter Claude Fable 5.1 kam auf eine Pass@1-Rate von 45,3 Prozent, das Schlusslicht GPT-5.6 Sol nur auf 9,4 Prozent. Dazwischen lagen GPT-6 Astra mit 32,5 Prozent, Claude Opus 5 mit 30,5 Prozent, Grok 4.6 mit 26,2 Prozent und Gemini 3.8 Flash mit 14,6 Prozent. Pass@1 bezeichnet den Anteil der Aufgaben, die ein Modell ohne weitere Korrekturschleifen direkt korrekt löst. Die Kosten pro Aufgabe variierten stark: Claude Fable 5.1 verursachte durchschnittlich 49,61 US-Dollar, GPT-6 Astra 52,37 Dollar, Claude Opus 5 46,31 Dollar, Grok 4.6 13,41 Dollar, Gemini 3.8 Flash 4,55 Dollar und GPT-5.6 Sol 16,53 Dollar. Eine klare Korrelation zwischen Kosten und Erfolg zeigt sich nicht: Das teuerste Modell, GPT-6 Astra, lag nur auf Platz zwei, während das günstigste, Gemini 3.8 Flash, die zweitschlechteste Pass@1-Rate aufwies. C5R veröffentlichte diese Zahlen im Rahmen des neuen Benchmarks SciUniverse, der erstmals reale Laborarbeit statt reiner Theorie prüft.

Facility-0: Ein physisches Labor mit über 40 Instrumenten

Facility-0 ist das erste modellgesteuerte Forschungslabor von C5R. Es wurde nach Angaben des Unternehmens in zwölf Wochen aufgebaut und deckt die Bereiche Biologie, Chemie und Materialwissenschaften ab. Die Software steuert und überwacht Instrumente von hydraulischen Pressen bis zu einzelnen Pipetten. Modelle können in dieser Umgebung das Inventar erkunden, Spezifikationen lesen und Experimente als Code entwerfen. Dieser Code wird in Anweisungen an Geräte und menschliche Operatoren übersetzt. Anschließend analysieren die Modelle Messergebnisse, planen neu und entscheiden über die nächsten Schritte. C5R hat nach eigenen Angaben über 40 wissenschaftliche Instrumente integriert, indem es Treiber per Reverse Engineering entschlüsselte und kundenspezifische Hardware-Adapter baute. Damit wird das physische Labor zu einer programmierbaren Umgebung, in der sich die Zuverlässigkeit von KI-Modellen bei der Umsetzung wissenschaftlicher Ziele in ausführbare Schritte testen lässt. Die Architektur setzt bewusst auf eine Zusammenarbeit von Modell und Mensch: Die Modelle geben Anweisungen, führen aber nicht alle Handlungen selbst aus.

Konkrete Fehler: Gefrorene Proben, wiederverwendete Pipettenspitzen

Die dokumentierten Fehlerfälle zeigen, dass die Modelle an grundlegenden Laborpraktiken scheitern. Ein Modell bemerkte nicht, dass Proben noch gefroren waren, und versuchte, sie direkt zu pipettieren. Ein anderes verwendete dieselbe Pipettenspitze zwischen DNA-haltigen Wells wieder, wodurch die gesamte Probengruppe kontaminiert wurde. Ein drittes Modell vortexte eine offene Platte, ohne die Verdunstung des Lösungsmittels zu berücksichtigen, was die Konzentrationen verfälschte. Diese Fehler betreffen elementare Arbeitsschritte, die jeder ausgebildete Laborant beherrscht. Sie offenbaren eine Diskrepanz zwischen dem theoretischen Wissen der Modelle und ihrer praktischen Umsetzung: Die Modelle können zwar korrekte Protokolle generieren, zeigen aber im Laborumfeld fehlende Kontext- und Sicherheitsprüfungen, etwa beim Umgang mit gefrorenen Proben oder der Vermeidung von Kreuzkontamination. Genau diese Lücke soll der Benchmark SciUniverse sichtbar machen.

SciUniverse: Ein Benchmark für echte Laborarbeit

SciUniverse ist ein Benchmark, der prüft, ob Modelle wissenschaftliche Ziele in verifizierbare Ergebnisse in Chemie, Biologie und Materialwissenschaften umsetzen können. Level 1 umfasst 92 Aufgaben aus sechs Kategorien: Probenvorbereitung, Instrumentensteuerung, Protokollanpassung, experimentübergreifendes Lernen, Facility-Management und Dateninterpretation. Nach Angaben von C5R sind diese Aufgaben für Wissenschaftler einfach und dauern höchstens ein paar Stunden. Der Benchmark unterscheidet sich von bestehenden Verfahren: Die meisten wissenschaftlichen Benchmarks erfassen nach Einschätzung von C5R einen zu engen Ausschnitt wissenschaftlicher Arbeit und beginnen erst nach dem Experiment mit sauberen Daten. SciUniverse hingegen testet den gesamten Prozess – von der Materialauswahl über die Gerätebedienung bis zur Fehlerbehebung. Durchgeführt werden kann der Benchmark in Facility-0 oder in dessen digitalem Zwilling.

Widersprüche: Wie autonom ist Facility-0 wirklich?

Bei der Darstellung von Facility-0 gibt es zwei dokumentierte Widersprüche. Erstens zur Anzahl der integrierten Geräte: C5R selbst nennt über 40 wissenschaftliche Instrumente, während die Plattform agihunt.info von 158 Geräten spricht, darunter Liquid Handler, Roboter, Sequenzierer und sogar Lichter. Die Unterschiede könnten auf verschiedene Zählweisen zurückgehen: agihunt.info zählt möglicherweise alle Geräte im Gebäude inklusive Beleuchtung, während C5R nur aktiv integrierte wissenschaftliche Instrumente meint. Die Primärquelle C5R nennt keine konkrete Gesamtzahl, sondern beschreibt die Spanne von hydraulischen Pressen bis zu einzelnen Pipetten. Zweitens zum Autonomiegrad: agihunt.info behauptet ein vollständig KI-gesteuertes Labor, in dem KI Experimente Ende-zu-Ende entwirft, ausführt und beobachtet. C5R selbst beschreibt dagegen eine Human-in-the-Loop-Architektur, bei der Modelle Anweisungen an menschliche Operatoren geben, die physische Handlungen ausführen. Diese Diskrepanz deutet darauf hin, dass agihunt.info die Autonomie übertreibt. Für die Glaubwürdigkeit der Darstellung bedeutet das: Die Primärquelle C5R ist zurückhaltender und präziser, während Drittberichte die Fähigkeiten überzeichnen können.

Niedrige Pass@1-Raten zeigen Lücken in praktischen Laborfähigkeiten

Für Anbieter von Frontier-Modellen verdeutlichen die niedrigen Pass@1-Raten, dass erheblicher Verbesserungsbedarf bei praktischen Laborfähigkeiten besteht. Selbst das beste Modell scheitert bei mehr als der Hälfte der einfachen Laboraufgaben, was auf fehlende praktische Fähigkeiten hinweist. Theoretisches Wissen allein reicht nicht aus, um in realen Umgebungen zuverlässig zu arbeiten. Für Forschungseinrichtungen bieten Facility-0 und SciUniverse eine realistischere Bewertungsgrundlage als reine Text-Benchmarks, da sie physische Interaktionen und Fehleranpassung einbeziehen. Einschränkend räumt C5R selbst ein, dass die Ergebnisse bei begrenzten Rollouts verrauscht sind. Zudem variieren die Kosten pro Aufgabe stark, was die Vergleichbarkeit erschwert. Die Befunde zeigen eine klare Richtung: KI-gesteuerte Forschung benötigt mehr als nur leistungsfähige Sprachmodelle – sie braucht eine enge Kopplung an reale Laborbedingungen und eine ehrliche Messung der praktischen Umsetzung.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel