ServiceNow veröffentlicht EVA-Bench Data 2.0 für Voice Agents
Offenes Benchmark-Set mit 213 Szenarien in drei Unternehmensdomänen, validiert gegen GPT-5.4, Gemini 3.1 Pro und Claude Opus 4.6
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- EVA-Bench Data 2.0 deckt drei Unternehmensdomänen ab: Airline Customer Service Management (CSM), Enterprise IT Service Management (ITSM) und Healthcare HR Service Delivery (HRSD).
- Das Benchmark-Set umfasst 213 Evaluationsszenarien und 121 Tools.
- Die Szenarien verteilen sich auf 50 für Airline CSM, 80 für ITSM und 83 für HRSD.
- Die Datensätze sind Open Source und über Hugging Face (ServiceNow-AI/eva-bench) als load_dataset verfügbar.
- Jedes Szenario wurde auf Lösbarkeit gegen drei Frontier-Modelle validiert: OpenAI GPT-5.4, Google Gemini 3.1 Pro und Anthropic Claude Opus 4.6.
- EVA-Bench führt zwei zusammengesetzte Metriken ein: EVA-A (Accuracy) und EVA-X (Experience).
Drei Domänen, 213 Szenarien: Der Umfang von EVA-Bench Data 2.0
ServiceNow AI Research hat EVA-Bench Data 2.0 veröffentlicht, ein offenes Benchmark-Set zur Bewertung von Sprach-KI-Agenten (Voice Agents). Das Set deckt drei Unternehmensdomänen ab: Airline Customer Service Management (CSM), Enterprise IT Service Management (ITSM) und Healthcare HR Service Delivery (HRSD). Insgesamt umfasst es 213 Evaluationsszenarien und 121 Tools; die Szenarien verteilen sich auf 50 für Airline CSM, 80 für ITSM und 83 für HRSD. Gegenüber der ursprünglichen Version erweitert Data 2.0 die Abdeckung von einer auf drei Domänen und erhöht die Szenarioanzahl um etwa das Vierfache. Die Szenarien stammen aus realen telefonischen Kundenservice-Workflows, und die Tool-Schemata sind an Produktions-API-Spezifikationen angelehnt. Die Healthcare-HRSD-Domäne bezieht reale US-Gesundheitsrichtlinien wie NPI-Provider-IDs, FMLA-Regelungen und Versicherungsdeckungsregeln ein. Das Set umfasst 39 Workflow-Typen; diese Vielfalt ist relevant, weil Fehler bei Voice Agents oft domänenspezifisch sind und unterschiedliche Domänen die Anpassungsfähigkeit an verschiedene Vokabulare, Workflow-Komplexitäten und Nutzererwartungen testen.
EVA-A und EVA-X: Zwei Metriken für Genauigkeit und Nutzererlebnis
Für die Bewertung führt EVA-Bench zwei zusammengesetzte Metriken ein: EVA-A (Accuracy) und EVA-X (Experience). EVA-A erfasst drei Teilaspekte: Aufgabenabschluss (task completion), also ob der Agent das Ziel des Anrufs korrekt erreicht; Faithfulness, also ob der Agent keine Richtlinien oder Fakten erfindet; und Audio-Sprachtreue (audio-level speech fidelity), also ob gesprochene strukturierte Entitäten wie Bestätigungscodes oder Mitarbeiter-IDs korrekt transkribiert werden. EVA-X erfasst ebenfalls drei Teilaspekte: Gesprächsverlauf (conversation progression), also ob der Dialog logisch voranschreitet; gesprochene Prägnanz (spoken conciseness), also ob Antworten nicht unnötig lang sind; und Turn-Taking-Timing, also ob der Agent angemessen schnell und ohne störende Pausen reagiert. Beide Metriken gelten nach Angaben der Forscher für alle gängigen Agentenarchitekturen und ermöglichen so direkte Vergleiche. Die Evaluation nutzt Bot-zu-Bot-Audiogespräche über dynamische Mehrrunden-Dialoge. Eine automatische Simulationsvalidierung erkennt Fehler des Nutzer-Simulators und generiert Gespräche vor dem Scoring neu, wenn nötig. Das Framework enthält zudem eine kontrollierte Störungssuite für Akzent- und Geräuschrobustheit sowie pass@1-, pass@k- und pass^k-Messungen, die Spitzen- von zuverlässiger Fähigkeit unterscheiden. Damit sollen sich verstärkende Fehlermodi erfasst werden, die komponentenbasierte Benchmarks übersehen.
Offen auf Hugging Face, validiert gegen GPT-5.4, Gemini 3.1 Pro und Claude Opus 4.6
Die drei Datensätze sind Open Source und über Hugging Face als load_dataset verfügbar (ServiceNow-AI/eva-bench). Jedes Szenario wurde auf Lösbarkeit gegen drei Frontier-Modelle validiert: OpenAI GPT-5.4, Google Gemini 3.1 Pro und Anthropic Claude Opus 4.6. Framework, Judge-Prompts und Code sind vollständig offen; laut einer Quelle unter MIT-Lizenz. EVA-Bench ist Teil der NOWAI-Bench Benchmark-Suite von ServiceNow; diese Zugehörigkeit ordnet das Set in einen größeren Benchmark-Kontext ein und ermöglicht Vergleichbarkeit innerhalb der Suite. Als verwandte Ressource für die Einordnung von Modellfähigkeiten dient der Artificial Analysis Intelligence Index. EVA-Bench richtet sich an mehrere Zielgruppen, insbesondere an Entwickler, die einen Voice Agent evaluieren möchten.



