Live ChatGPT Plus: Nutzer meldet früheres Konversationslimit
↘

KI-generierte Prüfungsfragen: Gleichwertig mit Expertenfragen – aber nicht überall

Eine auf der AIME-Con 2026 vorgestellte Studie hat ergeben, dass von generativer KI erstellte medizinische Prüfungsfragen inhaltlich und psychometrisch mit von Fachexperten erstellten Fragen vergleichbar sind.

· Veröffentlicht: 04.10.2026 ·7 Min Lesezeit
KI-generierte Prüfungsfragen: Gleichwertig mit Expertenfragen – aber nicht überallMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • Die Studie 'A Comprehensive Evaluation of GenAI-based Items in a Medical Examination' hat ergeben, dass KI-generierte medizinische Prüfungsfragen inhaltlich und psychometrisch mit von Fachexperten erstellten Fragen vergleichbar sind.
  • Die Studie wurde als Works in Progress auf der AIME-Con 2026 in Pittsburgh veröffentlicht.
  • Eine separate prospektive Evaluation mit GPT-4 zur Generierung von Pathologie-Prüfungsfragen ergab, dass von 260 Items 108 (41,5%) ohne Überarbeitung behalten, 86 (33,1%) mit Bearbeitung behalten und 66 (25,4%) verworfen wurden.
  • Ein systematisches Review identifizierte mehrere Studien, in denen KI zur Generierung von medizinischen Prüfungsfragen verwendet wurde.

KI-generierte Prüfungsfragen erreichen Experten-Niveau in Medizinprüfung

Auf der AIME-Con 2026 in Pittsburgh haben Forschende eine Studie vorgestellt, die nach eigenen Angaben eine umfassende empirische Evaluation generativer KI für medizinische Prüfungsfragen liefert. Die Arbeit mit dem Titel „A Comprehensive Evaluation of GenAI-based Items in a Medical Examination“ stammt von Yanlin Jiang, Marcus Walker, Andrew Dallas, Aquia Richburg, Nikole Gregg und Brittany Corrigan. Sie wurde als Works in Progress in den Proceedings der Artificial Intelligence in Measurement and Education Conference (AIME-Con) veröffentlicht, im Oktober 2026 im Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States, auf den Seiten 275 bis 281. Herausgeber sind Joshua Wilson, Christopher Ormerod und Magdalen Beiting-Parrish; die Publikation erfolgte beim National Council on Measurement in Education (NCME). Die Studie vergleicht KI-generierte medizinische Prüfungsfragen mit Items, die von Fachexperten (Subject Matter Experts, SMEs) entwickelt wurden. Grundlage sind Item-Inhalte und Antwortdaten aus einer High-Stakes-Prüfung. Das zentrale Ergebnis: Inhaltliche Qualität und psychometrische Kennwerte der KI-Items sind mit denen der Expertenfragen vergleichbar. Die Autorinnen und Autoren sehen darin eine empirische Bestätigung der Qualität KI-generierter Items und ihres möglichen Einsatzes in Bildungs- und Berufszertifizierungsprogrammen. Wichtig ist der Status als Works in Progress: Es handelt sich um eine laufende Arbeit, die noch nicht den vollen Peer-Review-Prozess durchlaufen hat. Die Befunde liefern dennoch einen konkreten empirischen Anhaltspunkt, dass generative KI unter bestimmten Bedingungen Prüfungsfragen erzeugen kann, die inhaltlich und messtechnisch nicht von menschlich erstellten Fragen abweichen. Die Bewertung stützt sich auf zwei Säulen: die inhaltliche Prüfung der Fragen sowie die Analyse der Antwortdaten, also wie die Items in der tatsächlichen Prüfung funktionierten. Welche Fachbereiche, Modelle und Prompt-Designs dabei zum Einsatz kamen, geht aus dem Abstract nicht hervor. Ebenso wenig werden die Anzahl der generierten Items oder die genauen psychometrischen Kennwerte genannt. Die Autorinnen und Autoren betonen jedoch, dass die Ergebnisse die Qualität von GenAI-basierten Items empirisch stützen und deren Potenzial für den Einsatz in Bildungs- und Berufszertifizierungsprogrammen aufzeigen. Da es sich um eine Works-in-Progress-Veröffentlichung handelt, sind weitere Validierungsschritte und eine vollständige Begutachtung erforderlich, bevor die Gleichwertigkeit als gesichert gelten kann.

Pathologie-Studie: 25 Prozent der KI-Items verworfen

Ein anderes Bild zeigt eine prospektive Evaluation aus der Pathologie. Während des akademischen Jahres 2024/2025 setzte ein Team GPT-4 mit einem standardisierten Prompt-Protokoll ein, um Multiple-Choice-Fragen für die Weiterbildung von Pathologie-Assistenzärzten zu generieren. Die Fragen deckten klinische Chemie, Hämatopathologie, klinische Mikrobiologie, Molekularpathologie, Bioinformatik und Transfusionsmedizin ab. Fachleute bewerteten jedes Item auf einer Skala von 1 bis 5 hinsichtlich Klarheit und Genauigkeit und vergaben eine Disposition: behalten ohne Änderung, behalten mit Bearbeitung oder verwerfen. Von 260 geprüften Items wurden 108 (41,5 Prozent) ohne Überarbeitung behalten, 86 (33,1 Prozent) mit Bearbeitung behalten und 66 (25,4 Prozent) verworfen. Das bedeutet: Mehr als die Hälfte der generierten Fragen war nicht ohne Eingriff verwendbar, ein Viertel fiel ganz durch. Die Unterschiede zwischen den Subdisziplinen waren erheblich. Die Molekularpathologie erreichte mit 60 Prozent uneditierter Übernahme die höchste Behaltensrate, während die klinische Mikrobiologie mit 41,7 Prozent eine vergleichsweise hohe Verwerfungsrate aufwies. Items, die ohne Revision behalten wurden, erzielten signifikant höhere Klarheits- und Genauigkeitswerte als verworfene Items. Bei Gesamtwerten von 6 bis 8 war die Wahrscheinlichkeit am höchsten, dass ein Item in die Kategorie ‚behalten mit Bearbeitung‘ fiel; Items mit Werten von 9 oder mehr hatten eine vorhergesagte Wahrscheinlichkeit von über 75 Prozent, behalten zu werden. Die Autorinnen und Autoren beschreiben eine anhaltende Spannung zwischen Effizienz und Strenge beim KI-gestützten Schreiben von Prüfungsfragen. Viele Gutachter hoben die gestraffte Produktion gut formatierter, prüfungsähnlicher Fragen hervor. Die hohe Verwerfungsquote relativiert die pauschale Aussage, KI-Items seien generell mit Expertenfragen gleichwertig. Sie zeigt, dass die Qualität stark vom Fachgebiet und von der Nachbearbeitung abhängt. Die prospektive Natur der Studie – alle generierten Fragen wurden ohne Vorauswahl bewertet – macht die Ergebnisse besonders aussagekräftig für den realen Einsatz ohne menschliche Vorselektion. Die Daten belegen, dass selbst mit einem standardisierten Prompt-Protokoll und einem leistungsfähigen Modell wie GPT-4 ein erheblicher Anteil der KI-generierten Items nicht direkt verwendbar ist und einer sorgfältigen fachlichen Prüfung bedarf.

Systematisches Review bestätigt breiten KI-Einsatz, aber uneinheitliche Qualität

Ein systematisches Review, das die PubMed-Literatur bis zum 6. Juni 2024 nach PRISMA-Richtlinien auswertete, identifizierte mehrere Studien, in denen KI zur Generierung medizinischer Prüfungsfragen eingesetzt wurde. Das Review bezieht sich auf Modelle wie Chat Generative Pre-Trained Transformer (OpenAI, San Francisco, CA). Die Übersichtsarbeit zeigt, dass der Einsatz generativer Modelle in der medizinischen Ausbildung über das reine Erstellen von Examensfragen hinausgeht: Die identifizierten Arbeiten nutzten KI auch, um klinische Skripte für Krankheitsbilder zu erstellen, diagnostische und klinische Fähigkeiten von Studierenden zu verbessern, als Lernhilfe zu dienen und Analyseaufgaben wie das Screening von Bewerbungen für Facharztstellen zu automatisieren. Die Autorinnen und Autoren des Reviews betonen, dass KI auf verschiedenen Ebenen und in unterschiedlichen Bereichen der medizinischen Ausbildung vielversprechend ist. Zugleich machen sie deutlich, dass die Qualität der generierten Inhalte nicht einheitlich ausfällt. Allerdings liefert das Abstract des Reviews keinen detaillierten Überblick über die einzelnen Studien: Es werden weder spezifische KI-Modelle, Fachbereiche noch Bewertungskriterien genannt, anhand derer die Qualitätsunterschiede konkret belegt werden könnten. Die Schlussfolgerung des Reviews, dass weitere Forschung erforderlich ist und Lehrende sowie Studierende die Prinzipien, Fähigkeiten und Grenzen von KI verstehen müssen, deutet jedoch darauf hin, dass die Studienlage heterogen ist und keine durchgängig hohe Qualität der generierten Prüfungsfragen belegt. Damit stützt die Übersichtsarbeit die Beobachtung, dass KI-generierte Prüfungsfragen nicht per se als gleichwertig mit menschlich erstellten Fragen gelten können. Der breite Einsatz von KI zur Item-Generierung ist dokumentiert, aber die uneinheitliche Qualität bleibt eine zentrale Einschränkung.

ABR-Warnung und Widerspruch zur Gleichwertigkeit

Zwischen der Hauptstudie und anderen Stimmen besteht ein deutlicher Widerspruch. Das American Board of Radiology (ABR) äußert sich in einer Stellungnahme von Board-of-Trustees-Vorsitzendem Matthew B. Podgorsak, PhD, und Executive Director Brent Wagner, MD, MBA, skeptisch zum Einsatz von KI bei der Erstellung von Prüfungsinhalten. Die Stellungnahme erschien im Februar 2026, Band 19, Nummer 1, Seite 3. Das ABR erkennt an, dass KI die Prozesse stark beeinflussen wird, und evaluiert proaktiv verschiedene Einsatzmöglichkeiten. Es plant, KI und Automatisierung für interne Geschäftsprozesse wie Terminplanung, Datenanalyse, Prognosen, Lückenanalysen und Projektmanagement zu nutzen. Beispielsweise analysiert das ABR aktiv Kommentare von Diplomaten zum Online Longitudinal Assessment (OLA), um Verbesserungen an einzelnen Fragen oder der systematischen Verteilung von Inhalten über die Wissensdomäne vorzunehmen. Für die Erstellung von Assessment-Inhalten – also Prüfungen und OLA – hält das Gremium KI jedoch für problematisch. Die Begründung: KI wirke auf den ersten Blick nützlich, erweise sich für diesen Zweck aber als sehr problematisch. Welche konkreten Mängel das ABR beobachtet hat, geht aus dem vorliegenden Auszug nicht hervor. Die Pathologie-Studie liefert dazu einen empirischen Anhaltspunkt: Ein Viertel der generierten Items wurde verworfen, ein weiteres Drittel musste bearbeitet werden. Das passt nicht zu einer pauschalen Gleichwertigkeit. Mögliche Gründe für die Diskrepanz liegen in unterschiedlichen Fachbereichen, Bewertungsmaßstäben, KI-Modellen und Prompt-Designs. Die Hauptstudie bewertet möglicherweise eine andere Art von Prüfung oder verwendet strengere Auswahlkriterien, sodass nur die besten KI-Items in den Vergleich einfließen. Die Pathologie-Studie hingegen prüfte alle generierten Fragen ohne Vorauswahl und dokumentierte die Verwerfungsrate. Auch der Status der Hauptstudie als Works in Progress ist relevant: Sie ist eine laufende Arbeit, deren Methodik und Ergebnisse noch nicht vollständig begutachtet sind. Die Gleichwertigkeit von KI-generierten und expertenbasierten Prüfungsfragen kann daher nicht pauschal angenommen werden. Sie hängt von Fachgebiet, Modell, Prompt-Design und Qualitätskontrolle ab. Die vorliegenden Daten zeigen sowohl vielversprechende Ergebnisse als auch erhebliche Qualitätsmängel – ein Widerspruch, den künftige Forschung auflösen muss. Die ABR-Stellungnahme verdeutlicht, dass selbst eine Fachgesellschaft, die KI für interne Prozesse nutzt, bei der Erstellung von Prüfungsinhalten Zurückhaltung übt. Zusammen mit den detaillierten Zahlen aus der Pathologie-Studie ergibt sich ein differenziertes Bild: KI-generierte Prüfungsfragen können unter bestimmten Bedingungen brauchbar sein, sind aber keineswegs automatisch mit Expertenfragen gleichwertig.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Ähnliche Artikel