
Ein in Dresden entwickelter KI-Agent stellt in Tests bis zu 90 Prozent korrekte Diagnosen, komplett lokal, ohne Cloud-Anbindung. Die Zuverlässigkeit der KI zeigt sich vor allem daran, ob sie bei wiederholter Prüfung immer zum gleichen Ergebnis kommt.
Text: Birgit Kofler
Große Sprachmodelle können mittlerweile komplexe medizinische Aufgaben übernehmen. Zwei Hürden stehen ihrem Routineeinsatz im klinischen Alltag aber im Weg: Patient*innendaten dürfen nicht an externe Anbieter fließen, und Ärzt*innen müssen einschätzen können, wie verlässlich eine KI-Diagnose ist. Ein Team um Prof. Jakob N. Kather vom Else Kröner Fresenius Zentrum (EKFZ) der TU Dresden hat nun ein System entwickelt, das für beide Themen Lösungen liefert: Es läuft komplett auf klinikeigener Infrastruktur und zeigt an, wann seinen Diagnosen zu trauen ist. Die Ergebnisse erschienen in Nature Medicine.
Getestet wurde das System in einer Simulationsumgebung: Zwei KI-Agenten interagieren miteinander, einer in der Rolle der Ärztin bzw. des Arztes, der andere in der Rolle der Patientin oder des Patienten. Grundlage des Tests waren anonymisierte Patient*innendaten aus mehr als 500 realen Fällen zu Krankheitsbildern wie etwa Blinddarmentzündung, Lungenembolie oder Harnwegsinfekt. Der ärztliche Agent konnte Rückfragen stellen und Befunde anfordern, bevor er eine Diagnose samt Begründung formulierte.
Das beste lokal betriebene Modell erreichte in zwei Testreihen 90 beziehungsweise 84 Prozent korrekte Diagnosen, ein cloudbasiertes Vergleichsmodell kam auf rund 91 Prozent. Das lokale System blieb also nur knapp dahinter zurück, obwohl es ganz ohne externe Server auskommt. Für 181 zufällig ausgewählte Fälle überprüften zusätzlich Ärzt*innen die KI-Diagnosen, die automatisierte Bewertung und die ärztliche Einschätzung stimmten dabei in mehr als 90 Prozent der Fälle überein.
Neben der diagnostischen Genauigkeit prüfte die Studie eine andere Kernfrage: Woran erkennt man, ob einer KI-Diagnose zu trauen ist? Am aussagekräftigsten erwies sich, ob die KI bei wiederholter Bearbeitung desselben Falls immer zur gleichen Diagnose kam. Dies war deutlich verlässlicher als die „interne Wahrscheinlichkeit“, mit der das Modell seine eigene Antwort einschätzt. Das zeigte auch ein Stresstest: Entzogen die Forschenden dem System verlässliche Ausgangsinformationen, fiel die Genauigkeit von rund 91 auf gut 70 Prozent. Kam die KI bei wiederholten Durchläufen zu unterschiedlichen Diagnosen, ließ sich der Genauigkeitseinbruch daran gut erkennen. Ihre eigene Wahrscheinlichkeitsangabe blieb dagegen oft unverändert hoch – die KI gab sich also selbstsicherer, als sie es hätte sein dürfen.
„Unser Ziel ist ein KI-Agent mit selektiver Autonomie. Diese Systeme sollen Ärzt*innen bei der Entscheidungsfindung unterstützen, diese aber niemals komplett übernehmen“, bringt Jakob Kather, das Ziel auf den Punkt. „Deshalb ist es wichtig, dass Ergebnisse der KI für Ärzt*innen nachvollziehbar sind und die Systeme transparent machen, wo sie unsicher sind. Die Verantwortung für Diagnose und Therapie wird auch in Zukunft immer beim Menschen bleiben.“
Der lokale Betrieb ist für Studienleiter Kather ein entscheidender Faktor. Weil Daten und Modelle vollständig im jeweiligen Krankenhaus bleiben, entscheiden die Einrichtungen selbst, wo Informationen verarbeitet werden und wer Zugriff hat.
„Forderungen nach einer Verlangsamung der KI-Entwicklung gehen aus meiner Sicht in die falsche Richtung. In der Medizin stehen wir ganz am Anfang: KI-Systeme, wie unsere Agenten, zeigen gerade erst, was möglich ist, und Patientinnen und Patienten profitieren bislang kaum davon. Wir brauchen mehr Tempo, nicht weniger“, sagt Kather. „Entscheidend ist, dass wir die Systeme so entwickeln, dass sie sicher, nachvollziehbar und datensouverän sind, etwa indem sie vollständig in der Klinik betrieben werden. Dafür muss Europa künftig aber auch bei der Grundlagentechnologie, also bei den Sprachmodellen selbst, eine Rolle spielen, statt nur auf Technologien anderer aufzubauen.“
Die Studie zeigt auch Grenzen des Systems auf. Bei simulierten Fällen älterer Patient*innen fiel die diagnostische Genauigkeit niedriger aus als bei jüngeren – warum, ist noch unklar. Zudem beruhen alle Ergebnisse auf retrospektiven Simulationen, nicht auf einer Erprobung im laufenden Klinikbetrieb. „Unsere Ergebnisse zeigen, dass wir auf dem Weg zu verlässlichen medizinischen KI-Agenten einen wichtigen Schritt weitergekommen sind“, ordnet das die Erstautorin der Studie Li Zhang ein. „Als Nächstes wollen wir untersuchen, wie sich dieser Ansatz unter realistischen Bedingungen bewährt, mit Ärztinnen und Ärzten im Prozess und mit einem breiteren Spektrum an Erkrankungen und klinischen Daten.“
Publikation: Li Zhang, Georg Wölflein, Dyke Ferber et al.: On-premise medical AI agents for reliable clinical decision-making. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04609-x (Open Access)
Titelbild: © DC Studio/Freepik/Magnific