KI lag falsch!

KI kann überzeugend falsch liegen – und genau das ist das Problem

Ein reales Beispiel mit ChatGPT, Gemini und einer falsch bestimmten Spinne

Beitragsbild zur KI-Spinnenbestimmung
Profilfoto

Ich beschäftige mich intensiv mit künstlicher Intelligenz und setze KI-Systeme regelmäßig für Recherche, technische Fragestellungen, Texte, Analysen und verschiedene Projekte ein.

Ich halte KI nach wie vor für eine der wichtigsten technologischen Entwicklungen unserer Zeit.

Aber ein aktueller Vorfall hat mir sehr deutlich gezeigt, wo eines der größten Probleme dieser Technologie liegt.

Nicht darin, dass eine KI einen Fehler macht.

Sondern darin, dass sie einen Fehler mit einer solchen Überzeugung vertreten kann, dass der Nutzer kaum noch erkennen kann, ob er gerade eine belastbare Information oder eine gut formulierte Fantasie liest.

Genau das ist mir passiert.

DER AUSGANGSPUNKT: EIN FOTO EINER SPINNE

In einem Forum wurde das Foto einer etwa drei bis vier Zentimeter großen Spinne veröffentlicht, die in Wien gefunden worden war.

Für mich war das gleichzeitig ein kleiner Test.

Ich wollte wissen, wie zuverlässig moderne multimodale KI-Systeme inzwischen bei einer eigentlich überschaubaren Aufgabe wie einer Tierbestimmung anhand eines Fotos arbeiten.

Also ließ ich das Bild von ChatGPT analysieren.

Die Antwort war eindeutig:

Mit hoher Wahrscheinlichkeit handele es sich um eine Nosferatu-Spinne, Zoropsis spinimana.

Die KI begründete ihre Antwort.

Körperbau, Beine, Größe und Fundort würden passen.

Wien passe ebenfalls zur inzwischen erfolgten Ausbreitung dieser ursprünglich mediterranen Art.

Das klang nachvollziehbar.

Es klang fachlich.

Es klang sicher.

ICH FRAGTE NOCH EINMAL NACH

Genau hier wird der Fall interessant.

Ich habe mich nämlich nicht mit der ersten Antwort zufriedengegeben.

Ich habe erneut nachgefragt.

Ich wollte Sicherheit.

Und genau an diesem Punkt hätte die KI eigentlich ihre vorherige Aussage kritisch hinterfragen müssen.

Sie hätte das Bild noch einmal unabhängig analysieren müssen.

Sie hätte fragen müssen:

Welche anatomischen Merkmale sind auf diesem Foto tatsächlich erkennbar?

Welche Merkmale wären für eine sichere Bestimmung notwendig?

Welche anderen Spinnengattungen kommen infrage?

Kann man anhand dieser Perspektive überhaupt seriös bis zur Art bestimmen?

Stattdessen passierte etwas völlig anderes.

Die ursprüngliche Aussage wurde erneut bestätigt.

Die falsche Bestimmung wurde weiter begründet.

Aus einer möglicherweise falschen ersten Einschätzung wurde dadurch für mich scheinbar eine überprüfte Information.

Und genau das ist gefährlich.

AUCH GEMINI KAM ZU EINEM VERGLEICHBAREN ERGEBNIS

Weil ich nicht nur einem einzelnen KI-System vertrauen wollte, stellte ich die Frage auch Gemini.

Auch dort fragte ich mehrfach nach.

Auch dort bekam ich eine scheinbar plausible und überzeugend formulierte Bestimmung.

Damit hatte ich aus meiner Sicht sogar eine Art Gegenprüfung vorgenommen.

Zwei unterschiedliche KI-Systeme kamen zu vergleichbaren Ergebnissen.

Was sollte daran noch falsch sein?

Genau diese Denkweise stellte sich anschließend als Problem heraus.

Denn zwei KI-Systeme sind nicht automatisch zwei unabhängige wissenschaftliche Gutachter.

Sie können auf ähnliche Trainingsdaten, ähnliche visuelle Muster und ähnliche Wahrscheinlichkeitsmodelle zurückgreifen und deshalb auch denselben Fehler machen.

Übereinstimmung zwischen mehreren KI-Systemen bedeutet deshalb nicht automatisch Wahrheit.

DANN MELDETEN SICH DIE FACHLEUTE

Im Forum reagierten Menschen, die sich intensiv mit Spinnen beschäftigen.

Und deren Kritik war deutlich.

Bei der Spinne handele es sich nicht um die von der KI genannte Nosferatu-Spinne.

Die sichtbaren anatomischen Merkmale sprächen vielmehr für die Gattung Harpactea, die sogenannten Langfinger.

Als mögliche Art wurde Harpactea rubicunda, der Große Langfinger, genannt.

Die Experten erklärten auch, woran sie das erkennen.

Dabei ging es nicht einfach um Farbe oder Körperform, sondern beispielsweise um Augenanordnung, Cheliceren, Pedipalpen, Beinstellung und weitere anatomische Strukturen.

Für eine endgültige Bestimmung bis zur exakten Art können je nach Exemplar sogar weitere Detailaufnahmen beziehungsweise sehr spezifische morphologische Merkmale erforderlich sein.

Und genau hier lag das Versagen der KI.

Sie hatte aus einem Bild, das möglicherweise überhaupt keine hundertprozentig sichere Artbestimmung zuließ, trotzdem eine konkrete Art genannt.

Und sie hatte diese Aussage anschließend noch verteidigt.

ICH MUSSTE MICH IM FORUM KORRIGIEREN

Das war mir unangenehm.

Denn ich hatte die KI-Antwort im guten Glauben weitergegeben.

Ich arbeite mit künstlicher Intelligenz.

Ich beschäftige mich intensiv damit.

Und trotzdem bin ich selbst in genau die Falle geraten, vor der man andere eigentlich warnen müsste.

Ich musste mich im Forum korrigieren und erklären, dass die von mir weitergegebene KI-Bestimmung falsch gewesen war.

Natürlich kann jeder Mensch einen Fehler machen.

Auch ein Biologe kann sich irren.

Auch ein Sachverständiger kann danebenliegen.

Aber hier war etwas anderes passiert.

Ich hatte nicht einfach eine falsche Antwort erhalten.

Ich hatte eine falsche Antwort erhalten, erneut nachgefragt und anschließend eine noch überzeugender klingende Bestätigung derselben falschen Aussage bekommen.

Das verändert die Qualität des Problems erheblich.

DAS EIGENTLICHE PROBLEM IST NICHT DER FEHLER

Eine künstliche Intelligenz muss nicht allwissend sein.

Das erwarte ich überhaupt nicht.

Was ich aber erwarte, ist eine erkennbare Trennung zwischen:

„Das weiß ich.“

„Das ist sehr wahrscheinlich.“

„Das könnte sein.“

und

„Das kann ich anhand der vorhandenen Informationen nicht zuverlässig bestimmen.“

Genau diese Trennung funktioniert bei generativer KI noch nicht zuverlässig genug.

Sprachmodelle sind sehr gut darin, plausible Erklärungen zu formulieren.

Das bedeutet aber nicht automatisch, dass die zugrunde liegende Schlussfolgerung richtig ist.

Ein Text kann perfekt formuliert sein.

Eine Erklärung kann logisch klingen.

Fachbegriffe können korrekt wirken.

Quellen können passend erscheinen.

Und die zentrale Aussage kann trotzdem falsch sein.

Das ist für mich inzwischen einer der wichtigsten Punkte beim Umgang mit künstlicher Intelligenz:

Sprachliche Überzeugungskraft ist keine Beweiskraft.

WARUM EINE ZWEITE NACHFRAGE NICHT AUTOMATISCH EINE ZWEITE PRÜFUNG IST

Dieser Fall hat noch etwas anderes gezeigt.

Wenn ich einer KI sage:

„Bist du sicher?“

oder

„Prüfe das noch einmal.“

dann bedeutet das nicht zwangsläufig, dass das System bei null beginnt.

Die vorherige Antwort befindet sich weiterhin im Gesprächskontext.

Dadurch kann die ursprüngliche Hypothese die weitere Analyse beeinflussen.

Das Modell kann dann beginnen, nach Argumenten zu suchen, die seine bestehende Antwort bestätigen, anstatt die ursprüngliche Antwort vollständig neu infrage zu stellen.

Das ist für Nutzer besonders problematisch.

Denn aus menschlicher Sicht bedeutet „noch einmal prüfen“:

Vergiss deine bisherige Meinung und kontrolliere die Sache erneut.

Bei einem Sprachmodell kann daraus aber faktisch werden:

Finde weitere Argumente für das, was du bereits gesagt hast.

Genau das darf nicht passieren.

AUCH PROZENTANGABEN WÜRDEN DAS PROBLEM NICHT AUTOMATISCH LÖSEN

Eine naheliegende Forderung wäre nun:

Dann soll die KI eben schreiben:

80 Prozent Wahrscheinlichkeit.

60 Prozent Wahrscheinlichkeit.

95 Prozent Wahrscheinlichkeit.

Auch damit muss man vorsichtig sein.

Denn eine vom Sprachmodell ausgegebene Prozentzahl ist nicht automatisch eine wissenschaftlich kalibrierte Wahrscheinlichkeit.

Eine KI könnte also schreiben:

„92 Prozent Wahrscheinlichkeit.“

Und diese Zahl könnte genauso irreführend sein wie eine zu selbstsicher formulierte Aussage.

Sinnvoller wäre deshalb zunächst eine verständliche Kennzeichnung:

GESICHERT Die Aussage ist durch eindeutige Merkmale oder überprüfbare Quellen bestätigt.
HOHE EVIDENZ Mehrere relevante Merkmale sprechen dafür und wichtige Alternativen wurden geprüft.
PLAUSIBEL Die Erklärung passt, entscheidende Merkmale oder Informationen fehlen jedoch.
SPEKULATIV Es handelt sich hauptsächlich um eine Arbeitshypothese.
NICHT ZUVERLÄSSIG BESTIMMBAR Die vorhandenen Informationen reichen für eine seriöse Aussage nicht aus.

Das wäre für mich wesentlich wertvoller als eine erfundene Genauigkeit auf zwei Nachkommastellen.

DAS ERSCHÜTTERT NATÜRLICH AUCH MEIN VERTRAUEN IN FRÜHERE ARBEIT

Genau an diesem Punkt wird die Sache für mich persönlich relevant.

Wenn ein KI-System bei einer vergleichsweise überschaubaren Aufgabe eine falsche Antwort produziert, diese anschließend erneut bestätigt und überzeugend begründet, stellt sich zwangsläufig eine weitere Frage:

Was ist mit all den anderen Dingen, die ich gemeinsam mit KI erarbeitet habe?

Sind technische Aussagen korrekt?

Stimmen historische Informationen?

Sind Produktdaten richtig?

Sind wissenschaftliche Erklärungen sauber?

Sind rechtliche Aussagen korrekt eingeordnet?

Sind Zahlen und Quellen tatsächlich belastbar?

Muss ich jetzt alles noch einmal überprüfen?

Diese Verunsicherung ist eine direkte Folge solcher Erfahrungen.

Und genau deshalb müssen KI-Anbieter dieses Problem ernst nehmen.

Vertrauen entsteht nicht dadurch, dass ein System niemals Fehler macht.

Vertrauen entsteht dadurch, dass ein System seine Grenzen zuverlässig erkennt und kommuniziert.

TROTZDEM WÄRE ES FALSCH, KI DESHALB ABZUSCHREIBEN

Nach diesem Erlebnis könnte man natürlich sagen:

Dann benutze ich keine KI mehr.

Das halte ich für den falschen Schluss.

KI kann außergewöhnlich leistungsfähig sein.

Sie kann große Informationsmengen strukturieren.

Sie kann Dokumente analysieren.

Sie kann Programmcode erklären und entwickeln.

Sie kann Recherche unterstützen.

Sie kann Zusammenhänge sichtbar machen.

Sie kann bei Ideenfindung, Automatisierung, Kommunikation und Wissensarbeit enorme Produktivitätsgewinne ermöglichen.

Aber KI ist kein Orakel.

Und sie ist kein Ersatz für jede Form menschlicher Fachkompetenz.

Der richtige Umgang liegt irgendwo zwischen zwei Extremen:

„KI ist unbrauchbarer Unsinn.“

und

„Die KI hat es gesagt, also stimmt es.“

Beides ist falsch.

MEINE REGELN FÜR DEN KÜNFTIGEN UMGANG MIT KI

Aus diesem Vorfall leite ich für meine eigene Arbeit einige klare Regeln ab.

1. Eine überzeugend formulierte Antwort ist noch kein Beleg.

2. Bei überprüfbaren Tatsachen müssen Quellen und Daten wichtiger sein als die sprachliche Sicherheit der KI.

3. Eine erneute Nachfrage beim selben KI-System ist keine unabhängige zweite Meinung.

4. Auch zwei unterschiedliche KI-Systeme können denselben Fehler machen.

5. Bei Bildern müssen diagnostische Merkmale entscheidend sein und nicht nur die allgemeine optische Ähnlichkeit.

6. Fehlen entscheidende Informationen, muss die KI das ausdrücklich sagen.

7. Bei Medizin, Recht, Sicherheit, Finanzen, technischen Spezifikationen und anderen folgenreichen Themen ist eine externe Validierung notwendig.

8. Quellen sollten nicht nur genannt, sondern bei wichtigen Aussagen tatsächlich kontrolliert werden.

9. Wenn KI und ausgewiesene Fachleute widersprechen, muss der Widerspruch untersucht werden und darf nicht automatisch zugunsten der KI entschieden werden.

10. „Ich weiß es nicht“ muss für ein KI-System eine vollkommen legitime Antwort sein.

UND WAS ICH VON DER KI SELBST ERWARTE

Der Nutzer kann und muss Verantwortung übernehmen.

Aber man kann die Verantwortung nicht vollständig auf den Nutzer abschieben.

Es kann nicht die Lösung sein, dass jeder Mensch erst einen zwanzigzeiligen Prompt schreiben muss, damit eine KI keine unbegründete Sicherheit produziert.

Ein gutes KI-System sollte selbst erkennen, wann Informationen fehlen.

Es sollte Alternativen berücksichtigen.

Es sollte zwischen Beobachtung und Interpretation unterscheiden.

Es sollte bei einer erneuten Prüfung bewusst versuchen, seine vorherige Antwort zu widerlegen.

Und es sollte eine konkrete Art, Diagnose, technische Ursache oder historische Behauptung nur dann mit hoher Sicherheit nennen, wenn die vorhandenen Informationen diese Sicherheit tatsächlich tragen.

Im konkreten Spinnenfall hätte die richtige Antwort beispielsweise lauten können:

„Auf dem Foto sind einige Merkmale erkennbar, die mehrere Arten beziehungsweise Gattungen zulassen. Eine sichere Artbestimmung ist aus dieser Perspektive nicht möglich. Harpactea sollte als Möglichkeit geprüft werden. Für eine genauere Bestimmung wären Detailaufnahmen bestimmter anatomischer Merkmale erforderlich.“

Damit hätte niemand ein Problem gehabt.

Das wäre keine Schwäche gewesen.

Das wäre eine gute Antwort gewesen.

MEINE KONSEQUENZ

Ich werde künstliche Intelligenz weiterhin nutzen.

Ich werde mich weiterhin intensiv mit ihr beschäftigen.

Und ich halte die Technologie weiterhin für außerordentlich wichtig.

Aber ich werde ihre Ergebnisse nicht mit Wahrheit verwechseln.

Und ich möchte auch andere Menschen ausdrücklich dazu ermutigen, KI zu benutzen.

Experimentiert damit.

Lernt damit.

Nutzt sie für Recherche, Ideen, Arbeit und Kreativität.

Aber behaltet euren eigenen Verstand eingeschaltet.

Denn das Gefährlichste an einer falschen KI-Antwort ist häufig nicht der Fehler selbst.

Das Gefährlichste ist eine falsche Antwort, die sich anhört wie die Wahrheit.

Mein Spinnenexperiment war dafür ein erstaunlich gutes Lehrstück.

Und ja:

Es war mir unangenehm, mich anschließend in einem Fachforum korrigieren zu müssen.

Aber vielleicht war genau dieser Fehler deshalb wertvoll.

Denn er zeigt sehr deutlich, welchen Umgang wir mit künstlicher Intelligenz lernen müssen.

Nicht blindes Vertrauen.

Nicht pauschales Misstrauen.

Sondern kontrolliertes Vertrauen.

KI sollte uns beim Denken helfen.

Sie sollte uns das Denken nicht abnehmen.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen