Künstliche Intelligenz kann große Mengen medizinischer Informationen verarbeiten, komplexe Fragen verstehen und bemerkenswert flüssige Antworten formulieren. Im Gesundheitswesen reicht sprachliche Qualität allein jedoch nicht aus.
Künstliche Intelligenz kann große Mengen medizinischer Informationen verarbeiten, komplexe Fragen verstehen und bemerkenswert flüssige Antworten formulieren. Im Gesundheitswesen reicht sprachliche Qualität allein jedoch nicht aus.
Eine der wichtigsten Herausforderungen medizinischer KI sind sogenannte Halluzinationen: Situationen, in denen ein KI-System Informationen erzeugt, die plausibel klingen, aber falsch, nicht ausreichend belegt oder mit mehr Sicherheit dargestellt werden, als die verfügbare Evidenz rechtfertigt.
In vielen Anwendungsbereichen ist eine fehlerhafte KI-Antwort lediglich ärgerlich. Im Gesundheitswesen können die Folgen wesentlich gravierender sein. Patientinnen und Patienten könnten Informationen falsch verstehen, medizinisches Personal könnte irreführende Hinweise erhalten und das Vertrauen in digitale Gesundheitstechnologien könnte geschwächt werden.
Deshalb darf die Reduzierung von Halluzinationen nicht von einer einzigen technischen Lösung abhängen. Bei Chatdok betrachten wir das Problem als eine mehrschichtige Sicherheitsaufgabe: mit verlässlichen Informationen, kontextbezogenem Verständnis, Verifikation und angemessener menschlicher Kontrolle.
Warum Halluzinationen im Gesundheitswesen besonders kritisch sind
Large Language Models sind darauf ausgelegt, Sprache zu generieren. Sie sind nicht automatisch medizinische Datenbanken, klinische Leitlinien oder autonome klinische Entscheidungssysteme.
Ein Modell kann eine sprachlich überzeugende Antwort formulieren, obwohl die zugrunde liegenden Informationen unvollständig oder falsch sind. Das Risiko steigt beispielsweise dann, wenn eine Frage mehrdeutig ist, die Evidenz begrenzt ist, wichtige Informationen zum Patienten fehlen oder das Modell außerhalb eines angemessen validierten Anwendungsbereichs eingesetzt wird.
Daraus ergibt sich ein entscheidender Unterschied:
Eine selbstbewusst formulierte Antwort ist nicht automatisch eine klinisch verlässliche Antwort.
Das Ziel medizinischer KI sollte daher nicht nur darin bestehen, Modelle leistungsfähiger zu machen. Es geht darum, Systeme zu entwickeln, die zwischen gesichertem Wissen, vertretbaren Schlussfolgerungen, fehlendem Kontext und Situationen unterscheiden können, in denen zusätzliche Evidenz oder menschliche Einschätzung erforderlich ist.
Unser Ansatz: mehrere Sicherheitsebenen
Bei Chatdok betrachten wir die Kontrolle von Halluzinationen nicht als einzelne Funktion. Stattdessen setzen wir auf mehrere sich ergänzende Sicherheitsebenen.
- Verlässliche medizinische Informationen als Grundlage
Die Qualität einer KI-generierten Antwort hängt wesentlich von den Informationen ab, auf denen das System aufbaut.
Für medizinische Anwendungen bedeutet das, mit verlässlichen, relevanten und angemessen gepflegten Informationsquellen zu arbeiten, anstatt das Sprachmodell selbst als alleinige Wahrheitsquelle zu betrachten.
Unser Ansatz legt deshalb Wert auf medizinisch relevante Wissensbestände und Evidenz, einschliesslich geeigneter wissenschaftlicher und aktueller Quellen.
Doch selbst hochwertige Informationen reichen nicht aus. Auch die beste Quelle verhindert nicht automatisch, dass ein KI-System eine Frage falsch interpretiert oder Informationen aus dem richtigen Kontext herauslöst und falsch anwendet.
Deshalb ist die nächste Ebene entscheidend.
- Den Kontext verstehen, bevor eine Antwort entsteht
Medizinische Fragen sind selten kontextfrei.
Dasselbe Symptom kann je nach Alter, Vorerkrankungen, Medikamenten, medizinischer Vorgeschichte und weiteren Umständen eine völlig unterschiedliche Bedeutung haben. Eine vage Frage kann deshalb zu einer Antwort führen, die zwar plausibel klingt, aber für die konkrete Situation ungeeignet ist.
Ein verantwortungsvoll entwickeltes medizinisches KI-System sollte erkennen, wenn wesentliche Informationen fehlen.
Statt sofort eine Antwort zu generieren, kann es notwendig sein, eine Rückfrage zu stellen, auf Einschränkungen hinzuweisen oder die Nutzerin bzw. den Nutzer an geeignete medizinische Unterstützung zu verweisen.
Das ist ein wichtiger Grundsatz unseres Ansatzes: Manchmal ist die sicherste Antwort einer KI nicht eine längere Antwort, sondern eine bessere Frage.
- Mehrschichtige Verifikation statt blindem Vertrauen in eine einzelne Ausgabe
Eine KI-generierte Antwort sollte nicht allein deshalb als korrekt gelten, weil sie überzeugend formuliert ist.
Unser Ansatz setzt deshalb auf mehrere Mechanismen zur Überprüfung, darunter die Bewertung von Sicherheit bzw. Konfidenz und interne Gegenprüfungen. Ziel ist es, Informationen zu identifizieren, die einer zusätzlichen Prüfung bedürfen.
Dabei geht es nicht darum, künstliche Gewissheit zu erzeugen. Im Gegenteil: Es geht darum zu erkennen, wenn Gewissheit nicht gerechtfertigt ist.
Wo es angemessen ist, kann zusätzlich eine fachliche oder klinische Prüfung erforderlich sein.
So entsteht eine robustere Architektur: Statt eine einzelne Modellausgabe automatisch als richtig zu behandeln, werden mehrere Sicherheitsebenen eingesetzt, um Antworten zu hinterfragen und zu validieren.
- Unsicherheit transparent machen
Ein zentraler Bestandteil vertrauenswürdiger medizinischer KI ist Transparenz.
Wenn ein KI-System unsicher ist, sollte diese Unsicherheit nicht durch selbstbewusste Formulierungen verborgen werden.
Nutzerinnen und Nutzer müssen die Grenzen dessen verstehen können, was das System zuverlässig leisten kann. Das kann bedeuten, Einschränkungen transparent zu machen, zusätzliche Informationen abzufragen, eine professionelle medizinische Abklärung zu empfehlen oder bei unzureichender Evidenz auf eine Antwort zu verzichten.
Für uns ist das keine Schwäche von KI.
Zu wissen, wann man nicht antworten sollte, ist Teil eines verantwortungsvollen KI-Systems.
Die Kontrolle von Halluzinationen ist ein kontinuierlicher Prozess
Die Reduzierung von Halluzinationen ist keine Prüfung, die einmal vor dem Start eines medizinischen KI-Systems durchgeführt werden kann.
Modelle, Daten, medizinische Leitlinien, Nutzerverhalten und reale Anwendungsszenarien entwickeln sich weiter. Neue Fehlerbilder können entstehen, und Systeme müssen entsprechend kontinuierlich überprüft und verbessert werden.
Verantwortungsvolle medizinische KI erfordert deshalb eine fortlaufende Evaluation: schwierige Fragestellungen testen, wiederkehrende Fehler erkennen und Sicherheitsebenen dort weiterentwickeln, wo Risiken sichtbar werden.
Dabei sollte nicht behauptet werden, Halluzinationen könnten in jeder Situation vollständig ausgeschlossen werden. Eine solche Aussage würde ein falsches Sicherheitsgefühl erzeugen.
Das Ziel ist vielmehr, Risiken systematisch zu reduzieren, Unsicherheit zu erkennen und zu verhindern, dass unzuverlässige Informationen als medizinische Wahrheit behandelt werden.
Warum das für das Vertrauen der Patienten entscheidend ist
Technische Leistungsfähigkeit und Vertrauen sind eng miteinander verbunden.
Patientinnen und Patienten müssen darauf vertrauen können, dass ein digitales Gesundheitssystem auf ihre Sicherheit ausgerichtet ist und nicht lediglich darauf, möglichst beeindruckende Antworten zu erzeugen. Ärztinnen und Ärzte benötigen die Sicherheit, dass KI ihre Arbeit unterstützt, ohne verborgene Risiken oder ungeprüfte Informationen einzuführen.
Deshalb sollte medizinische KI aus unserer Sicht nicht allein nach der Leistungsfähigkeit eines Modells beurteilt werden.
Sie sollte klinisch relevant, transparent, überprüfbar und angemessen beaufsichtigt sein.
Die nützlichste KI ist nicht unbedingt diejenige, die jede Frage beantwortet.
Es ist diejenige, die erkennt, wann sie antworten kann, wann sie mehr Kontext benötigt, wann sie Unsicherheit kommunizieren muss und wann ein Mensch einbezogen werden sollte.
Von leistungsfähiger KI zu vertrauenswürdiger medizinischer KI
Halluzinationen gehören zu den zentralen Herausforderungen generativer KI im Gesundheitswesen. Ihre Reduzierung erfordert mehr als eine Verbesserung des zugrunde liegenden Sprachmodells.
Notwendig ist eine Architektur aus mehreren Sicherheitsmechanismen: verlässliche Informationen, Kontextverständnis, Verifikation, transparente Kommunikation und angemessene menschliche Kontrolle.
Bei Chatdok verstehen wir dies als Teil eines übergeordneten Prinzips für KI im Gesundheitswesen:
Leistungsfähigkeit schafft Möglichkeiten. Sicherheit schafft Vertrauen. Klinische Verantwortung schafft Wert.
Mit der zunehmenden Integration von KI in das Gesundheitswesen wird die Reduzierung von Halluzinationen eine fortlaufende technische, klinische und regulatorische Herausforderung bleiben. Unser Ziel ist es, dieser Herausforderung systematisch zu begegnen – und KI-Systeme zu entwickeln, die nicht nur intelligent sind, sondern auch ihre Grenzen erkennen und zu einer sichereren und vertrauenswürdigeren Gesundheitsversorgung beitragen.