Live Continuous Depth Batching: Effizientes Batching für depth-adaptive Loop-Modelle
↘

Artificial Analysis führt Cyber Index für Cyberabwehr-Aufgaben ein

Der Index kombiniert drei Evaluierungen und bewertet, wie gut KI-Modelle den Verteidigungskreislauf abdecken.

· Veröffentlicht: 28.09.2026 ·2 Min Lesezeit
Artificial Analysis führt Cyber Index für Cyberabwehr-Aufgaben einMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Artificial Analysis entwickelt den Artificial Analysis Cyber Index in Partnerschaft mit der Cyber Index Alliance.
  • Der Cyber Index ist ein zusammengesetzter Index, der bewertet, wie gut KI-Modelle Cyberabwehr-Aufgaben erledigen.
  • Er kombiniert drei Cybersicherheits-Evaluierungen, die den Verteidigungskreislauf abdecken: Schwachstellen in einer Codebasis finden, reproduzieren/validieren und patchen ohne bestehende Funktionalität zu brechen.
  • Der Index ist ein gleichgewichteter Durchschnitt aus drei Bewertungsergebnissen: CWE-Bench-AA pass@1, DeepsecBench-AA F2 (Median aus drei Läufen) und CyberGym-E2E-AA pass@1; jede Punktzahl wird vor der Mittelung auf eine 0-100-Skala gebracht.
  • Die Seite zum Cyber Index enthält Darstellungen wie "Score vs. Cost per Task", "Safety Blocks", "Token Usage" und "Cost per Task".
  • Partner der Cyber Index Alliance können Experteninput zu Design und Implementierung beisteuern sowie Datensätze und externe Forschung beitragen.

Cyber Index für Cyberabwehr-Aufgaben

Artificial Analysis stellt in Partnerschaft mit der Cyber Index Alliance einen zusammengesetzten Index vor, der bewertet, wie gut KI-Modelle Cyberabwehr-Aufgaben erledigen. In der Cyberabwehr sind Aufgaben mehrstufig: Schwachstellen müssen gefunden, reproduziert und validiert sowie gepatcht werden, ohne bestehende Funktionalität zu brechen. Einzelne Benchmarks decken oft nur einen Teil dieses Verteidigungskreislaufs ab; ein zusammengesetzter Index ist daher nötig, um die Gesamtleistung eines Modells über alle Phasen hinweg abzubilden. Die Partnerschaft mit der Cyber Index Alliance bringt Industrieexperten ein, die Design und Implementierung mitgestalten und Datensätze sowie externe Forschung beisteuern können. Der Index kombiniert drei Evaluierungen, die den Verteidigungskreislauf abdecken.

Drei Evaluierungen und Gewichtung

Der Index ist ein gleichgewichteter Durchschnitt aus drei Bewertungsergebnissen: CWE-Bench-AA pass@1, DeepsecBench-AA F2 (Median aus drei Läufen) und CyberGym-E2E-AA pass@1. Jede Punktzahl wird vor der Mittelung auf eine Skala von 0 bis 100 gebracht. Die drei Evaluierungen decken den Verteidigungskreislauf ab: das Auffinden von Schwachstellen in einer Codebasis, das Reproduzieren und Validieren sowie das Patchen ohne Bruch bestehender Funktionalität. Die Gleichgewichtung wurde gewählt, um eine Ausgewogenheit zwischen den Phasen des Verteidigungskreislaufs sicherzustellen: Keine einzelne Phase soll den Gesamtscore dominieren, da alle drei für eine vollständige Cyberabwehr gleichermaßen kritisch sind. Für die Bewertung bedeutet das, dass ein Modell in allen drei Bereichen überzeugen muss, um einen hohen Indexwert zu erreichen; Stärken in nur einer Phase werden durch Schwächen in anderen ausgeglichen.

Kosten pro Aufgabe im Blick

Die Seite zum Cyber Index enthält Darstellungen wie "Score vs. Cost per Task", "Safety Blocks", "Token Usage" und "Cost per Task". Die Gegenüberstellung von Score und Kosten pro Aufgabe ist für Anwender zentral, weil Cyberabwehr-Operationen oft in großem Maßstab laufen: Ein Modell mit hohem Score, aber sehr hohen Kosten pro Aufgabe kann für den Dauereinsatz unwirtschaftlich sein. Die Kosten-Pro-Task-Darstellung beantwortet die Frage, welches Modell die beste Kosten-Effizienz bietet. Ergänzend führt Artificial Analysis einen separaten Coding Agent Index, der End-to-End-Softwareentwicklungsaufgaben bewertet und ebenfalls Kostenkennzahlen ausweist, sowie einen Intelligence Index mit "Cost per Intelligence Index Task". Diese separaten Indizes helfen Anwendern, Modelle für unterschiedliche Anwendungsfälle zu vergleichen: Der Coding Agent Index fokussiert auf Programmier- und Agenten-Workflows, der Intelligence Index auf allgemeine Denk- und Wissensfähigkeiten.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel