UK AISI veröffentlicht erstmals Benchmark-Ergebnisse über Evaluation Cards
Das UK AI Security Institute (UK AISI) und die EvalEval Coalition haben eine Zusammenarbeit formalisiert, um KI-Benchmark-Evaluierungen über die offene Infrastruktur von EvalEval zu standardisieren und öffentlich zugänglich zu machen. Konkret veröffentlicht UK AISI nun verifizierte Benchmark-Ergebni
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- UK AISI und die EvalEval Coalition haben eine Zusammenarbeit formalisiert, um KI-Benchmark-Evaluierungen zu standardisieren und öffentlich zugänglich zu machen.
- Die Partnerschaft baut auf Forschung auf, die ursprünglich auf einem gemeinsamen NeurIPS-2025-Workshop präsentiert wurde, und geht von der theoretischen Framework-Entwicklung zur aktiven Bereitstellung über.
- UK AISI veröffentlicht nun verifizierte Benchmark-Ergebnisse, methodische Konfigurationen und kontextuelle Metadaten über Evaluation Cards.
- Die erste Veröffentlichung umfasst fünf primäre Benchmarks und zwei ergänzende Cybersecurity-Evaluierungen.
- Die erste Veröffentlichung untersucht sechs Frontier-Sprachmodelle: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 und GPT-5.4.
- Die geteilten Daten begleiten eine kürzliche Veröffentlichung des Instituts, die analysiert, wie Inference-Time-Compute und Evaluierungsprotokolle die Modellleistung beeinflussen.
UK AISI veröffentlicht erstmals Benchmark-Ergebnisse über Evaluation Cards
Das UK AI Security Institute (UK AISI) und die EvalEval Coalition haben ihre Zusammenarbeit formalisiert, um KI-Benchmark-Evaluierungen zu standardisieren und öffentlich zugänglich zu machen [Herstellerangabe]. Die Partnerschaft baut auf Forschung auf, die ursprünglich auf einem gemeinsamen NeurIPS-2025-Workshop präsentiert wurde [Herstellerangabe]. Konkret veröffentlicht UK AISI nun verifizierte Benchmark-Ergebnisse, methodische Konfigurationen und kontextuelle Metadaten über die Plattform Evaluation Cards [Herstellerangabe]. Damit adressiert das Institut nach eigenen Angaben einen zentralen Engpass der KI-Sicherheitsforschung: die weit verbreitete Inkonsistenz und mangelnde Reproduzierbarkeit veröffentlichter Modellevaluierungen [Herstellerangabe]. Die Plattform stellt dafür standardisierte Metadatenfelder wie Prompt-Templates, Inferenzparameter und Systemzustände bereit und ermöglicht den direkten Vergleich von Ergebnissen aus verschiedenen Frameworks wie HELM, EleutherAI oder Inspect [Herstellerangabe]. Durch die Angabe von Setup-Parametern und Token-Nutzungslimits liefert die Veröffentlichung überprüfbare Referenzpunkte, die es Forschern ermöglichen, zu isolieren, wie spezifische Testbedingungen die berichteten Scores beeinflussen [Herstellerangabe].
Erste Veröffentlichung umfasst fünf Benchmarks und sechs Frontier-Modelle
Die erste Veröffentlichung umfasst fünf primäre Benchmarks und zwei ergänzende Cybersecurity-Evaluierungen; die konkreten Titel dieser Benchmarks und Evaluierungen werden in der Quelle nicht einzeln aufgeführt [Herstellerangabe]. Untersucht werden sechs Frontier-Sprachmodelle: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 und GPT-5.4 [Herstellerangabe]. Die geteilten Daten begleiten eine kürzliche Veröffentlichung des Instituts, die analysiert, wie Inference-Time-Compute und Evaluierungsprotokolle die Modellleistung beeinflussen [Herstellerangabe]. Durch die Dokumentation von Setup-Parametern und Token-Nutzungslimits sollen die Ergebnisse als verifizierbare Referenzpunkte dienen, um den Einfluss spezifischer Testbedingungen auf die berichteten Scores zu isolieren [Herstellerangabe].
EvalEval-Format sichert Reproduzierbarkeit durch UUIDs und Zeitstempel
Das EvalEval-Datenformat stellt ein einheitliches, offenes Schema für KI-Evaluierungsergebnisse bereit [Herstellerangabe]. Jeder Evaluierung wird eine eindeutige UUID zugewiesen, um Dateinamenskollisionen zu verhindern und mehrere Läufe desselben Modells mit unterschiedlichen Daten oder Konfigurationen sicher zu koexistieren [Herstellerangabe]. Zudem ist das Feld retrieved_timestamp verpflichtend, das den genauen Zeitpunkt der Inferenz erfasst [Herstellerangabe]. Damit sollen präzise Studien zu API-Drift und Modellversionierung ermöglicht werden [Herstellerangabe]. Das Format erlaubt, Ergebnisse aus Frameworks wie HELM, EleutherAI, Inspect und eigenen Skripten direkt zu vergleichen, ohne komplexe Zuordnungen [Herstellerangabe].
Evaluation Cards dokumentiert auch undokumentierte Felder
Evaluation Cards ist ein Reporting-Layer über KI-Modell-Evaluierungen, entwickelt von der EvalEval Coalition [Herstellerangabe]. Die Plattform sammelt, wie Modelle über viele Benchmarks und berichtende Organisationen hinweg evaluiert werden, und zeigt zugleich, was undokumentiert blieb [Herstellerangabe]. Laut einer Auswertung der Plattform weisen 94 Prozent der berichteten Scores mindestens ein undokumentiertes Feld auf [Herstellerangabe]. Am häufigsten fehlen die Angaben zu max tokens (93 Prozent) und temperature (92 Prozent) [Herstellerangabe]. Das Fehlen dieser Angaben schränkt die unabhängige Reproduzierbarkeit ein, weil max tokens die maximale Länge der Modellantwort begrenzt und temperature die Zufälligkeit der Ausgabe steuert; ohne diese Parameter lässt sich das Modellverhalten unter den ursprünglichen Testbedingungen nicht exakt nachstellen [Herstellerangabe]. Damit macht Evaluation Cards sichtbar, welche Evaluierungen nicht unabhängig reproduzierbar sind [Herstellerangabe].



