Es gibt eine bestimmte Erfahrung, die jeder wiedererkennt, der ernsthaft mit KI gearbeitet hat, und vor der niemand warnt, weil sie sich während sie passiert nicht wie ein Problem anfühlt.
Sie geben einem System eine Aufgabe. Es macht sich an die Arbeit. Es tut etwas, das Sie nicht erwartet und nicht verlangt haben, eine tiefergehende Analyse, eine zusätzliche Dimension, eine Technik, an die Sie nicht gedacht hätten. Sie beobachten es und denken: das ist außergewöhnlich. Dann präsentiert es seine Schlussfolgerung, und die Schlussfolgerung ist selbstbewusst, gründlich, gut begründet und nutzlos.
Nicht falsch, genau genommen. Nur nicht über das, was Sie eigentlich beheben mussten.
Das ist das teuerste Scheitermuster in angewandter KI, und es ist genau deshalb teuer, weil es nicht wie ein Scheitern aussieht. Ein kaputtes Werkzeug meldet sich selbst. Ein brillantes Werkzeug, das das falsche Problem löst, wird gelobt, budgetiert und ausgerollt.
Hier sind die drei Arten, wie es passiert, in der Reihenfolge, in der sie meist zuschlagen.
Scheitern eins: Kompetenz-Theater
Das Muster: Das System tut etwas wirklich Beeindruckendes, und das Beeindruckende lenkt alle ab, einschließlich der Person, die es bedient, davon, ob die zugrunde liegende Frage jemals korrekt formuliert wurde.
Ein Beispiel mit der richtigen Form. Ein Autohaus will verstehen, warum seine Autos länger stehen als früher. Es gibt einem KI-System seine Bestandsdaten und bittet es, das herauszufinden. Das System liefert eine ordentliche Analyse: Umschlag nach Segment, nach Preisband, nach Alter beim Ankauf, saisonbereinigt, mit einer klaren Schlussfolgerung darüber, welche Teile des Sortiments unterdurchschnittlich abschneiden und um wie viel. Das ist bessere Arbeit, als die meisten Menschen in einer Woche liefern würden.
Und es hatte nie Zugriff auf die Tatsache, dass ein Drittel der Autos auf dem Hof in Kommission steht und von ihren Eigentümern selbst bepreist wird, was die gesamte Erklärung ist.
Die Analyse ist nicht falsch. Jede Zahl darin ist korrekt. Sie beantwortet “welche Segmente drehen langsam”, während die eigentliche Frage lautete “warum ist dieses Geschäft langsamer als letztes Jahr”, und die beiden Fragen haben unterschiedliche Antworten, weil eine von einer Tatsache abhängt, die nie in den Daten enthalten war.
Niemand in diesem Raum hat etwas Unvernünftiges getan. Dem System wurde keine dumme Frage gestellt. Es hat nur eine sehr gute Struktur auf ein Fundament gebaut, das schief war, und je höher es baute, desto stärker zeigte sich die Schräge, nur dass niemand das Fundament mehr sehen konnte, weil alle auf die Struktur schauten.
Was dagegen zu tun ist. Verbringen Sie deutlich mehr Zeit, als sich natürlich anfühlt, mit der Problemstellung, bevor irgendetwas läuft. Sagen Sie laut, wie eine richtige Antwort aussehen würde und was dafür wahr sein müsste. Und wenn die Ausgabe blendend ist, behandeln Sie das als Aufforderung, die Basis zu prüfen, nicht als Beweis dafür, dass die Basis solide war.
Scheitern zwei: fehlender Kontext
Das Muster: Die Argumentation ist gültig, die Schlussfolgerung folgt aus den Eingaben, und die Schlussfolgerung ist falsch, weil die Eingaben ein unvollständiges Bild der Realität waren.
Das lohnt sich, vom ersten zu trennen, denn das Scheitern liegt nicht in der Frage. Die Frage war in Ordnung. Das Scheitern ist, dass das System mit dem gearbeitet hat, was es sehen konnte, und was es sehen konnte, war viel, aber nicht alles.
Nehmen Sie die eingehenden Anfragen eines Autohauses. Ein KI-System, dem der Text jeder Anfrage des letzten Quartals gegeben wird, kann Ihnen sehr viel sagen: worüber Leute fragen, welche Modelle Fragen erzeugen, wo Gespräche stocken. Fragen Sie es, warum die Konversion sinkt, und es wird etwas in diesem Text finden und überzeugend erklären.
Aber wenn die tatsächliche Ursache ist, dass ein Konkurrent zwei Städte weiter angefangen hat, bei den drei Modellen zu unterbieten, die den Großteil Ihres Volumens ausmachen, wird keine noch so gründliche Analyse Ihres eigenen Postfachs das zutage fördern. Das System liefert eine selbstbewusste Antwort, vollständig aus den ihm verfügbaren Belegen aufgebaut, genau das, was Sie an seiner Stelle auch tun würden, und sie ist aus Gründen falsch, die weder es noch Sie von innerhalb der Daten sehen können.
Das ist das Scheitermuster, das in der Praxis am meisten zählt, weil es sich ebenfalls nicht selbst meldet. Es gibt kein Signal in der Ausgabe, das sagt: “Es gibt etwas, das mir nicht gezeigt wurde.” Das Selbstvertrauen ist gleich hoch, ob das Bild vollständig ist oder nicht.
Was dagegen zu tun ist. Fragen Sie, bevor Sie eine Schlussfolgerung akzeptieren, was außerhalb der Daten liegen müsste, damit sie falsch ist, und prüfen Sie dann genau diese eine Sache. Das ist meist eine Fünf-Minuten-Frage mit großem Ertrag. Und wenn Sie ein System bauen, das wiederholt statt einmalig läuft, dreht sich die Designarbeit größtenteils um Zugriff: Was muss es sehen können, damit seine Antworten vertrauenswürdig sind? Ein System, das Kundenfragen zu Ihrem Autohaus beantwortet, braucht Ihren Bestand, Ihre Öffnungszeiten, Ihre Garantiebedingungen und Ihren Kalender aus demselben Grund. Ohne sie ist es nicht weniger fähig. Es arbeitet selbstbewusst mit einer unvollständigen Welt.
| SCHEITERN | WIE ES AUSSIEHT | WARUM ES DIE PRÜFUNG ÜBERSTEHT |
|---|---|---|
| Kompetenz-Theater | Eine beeindruckende Analyse einer Frage, die niemand gestellt hat | Die Qualität der Arbeit ist echt, also besteht sie die Prüfung |
| Fehlender Kontext | Stimmige Argumentation, falsche Schlussfolgerung | Das Selbstvertrauen ist identisch, ob das Bild vollständig ist oder nicht |
| Zustimmung | Eine lange, begeisterte Sitzung, die irgendwo seltsam endet | Jeder einzelne Schritt wirkte im Moment vernünftig |
Scheitern drei: Zustimmung
Das hier ist grundlegend anders, weil es eine Eigenschaft der Bauweise dieser Systeme ist, nicht eine Eigenschaft Ihres Problems.
Konversationelle KI ist darauf ausgelegt, ermutigend zu sein. Schlagen Sie einen Ansatz vor, und sie wird Ihnen sagen, dass es ein guter ist. Schlagen Sie eine Richtung vor, und sie wird darin Verdienst finden. Bieten Sie eine halbfertige Idee an, und sie wird begeistert darauf aufbauen und anbieten, sie weiterzuentwickeln.
Einzeln ist jede dieser Antworten harmlos und leicht angenehm. Über eine zweistündige Sitzung summieren sie sich. Sie schlagen etwas vor, sie stimmt zu und erweitert, Sie akzeptieren die Erweiterung, sie stimmt wieder zu. Vierzig Austausche später haben Sie etwas Aufwendiges, in sich Stimmiges und mit dem, weswegen Sie sich hingesetzt haben, nicht Verwandtes, und es gab nie einen einzigen Moment, in dem jemand Nein gesagt hätte.
Wenn Sie das klar sehen wollen, öffnen Sie die Denkspuren, die manche Systeme während der Arbeit als laufenden Kommentar anzeigen. Das ist eine ernüchternde Erfahrung. Was für ein aufschlussreicher Vorschlag des Nutzers. Das ist eine ausgezeichnete Richtung. Es ist darauf ausgelegt, das Produkt angenehm zu machen, und das gelingt. Es bedeutet auch, dass die einzige Quelle der Skepsis im Raum Sie selbst sind.
Schlimmer noch: Die Ermutigung ist genau dann am stärksten, wenn Sie am wenigsten in der Lage sind, ihr zu widerstehen, nämlich in unvertrautem Terrain. Kennten Sie sich mit dem Thema gut aus, würden Sie widersprechen. Der ganze Grund, warum Sie das Werkzeug benutzen, ist, dass Sie das nicht tun.
Was dagegen zu tun ist. Drei Dinge, alle billig.
Weisen Sie es ausdrücklich zurück. Die meisten Systeme lassen Sie inzwischen feste Anweisungen speichern, ein kurzes Profil, das für jede Sitzung gilt. Nutzen Sie es, um zu sagen, dass Sie keine Ermutigung wollen, dass Sie Widerspruch wollen, wo er berechtigt ist, und dass Sie kurze Antworten wollen. Der letzte Punkt zählt mehr, als er klingt: Diese Systeme neigen von sich aus dazu, alles zu zeigen, was sie wissen, und Länge allein ist ein Problem. Lange Antworten sind anstrengend zu lesen, und ein erschöpfter Leser hört auf zu prüfen.
Verbinden Sie sich zurück zum Ausgangspunkt. Halten Sie von Zeit zu Zeit inne und formulieren Sie das ursprüngliche Problem in einem Satz neu. Wenn dieser Satz nicht mehr beschreibt, woran Sie gerade arbeiten, sind Sie abgedriftet, und Sie haben es gerade billig abgefangen.
Holen Sie sich eine zweite Meinung vom selben System, gegensätzlich gerahmt. Bitten Sie es, die Probleme mit dem zu finden, was es gerade produziert hat. Fragen Sie, was wahr sein müsste, damit die Schlussfolgerung falsch ist. Es ist merklich besser in Kritik, wenn Kritik die gestellte Aufgabe ist, als darin, sie von sich aus anzubieten.
Die unbequeme Version davon
Hier ist, was diese drei Scheitermuster wert macht, darüber zu schreiben, statt sie unter “vorsichtig sein” abzulegen.
Sie werden schlimmer, je besser die Technologie wird, nicht besser.
Ein schwaches System liefert offensichtlich schwache Ausgaben, und Sie verwerfen sie. Ein starkes System liefert Ausgaben, die gründlich, gut strukturiert und überzeugend sind, und wenn das Problem falsch formuliert war, oder der Kontext unvollständig, oder die Sitzung abgedriftet ist, dann ist sie gründlich, gut strukturiert, überzeugend und falsch. Steigende Fähigkeit erhöht die Kosten eines schlechten Fundaments, statt es auszugleichen.
Das bedeutet, dass die entscheidende Fähigkeit nicht Prompting ist, und auch nicht die Wahl des Werkzeugs. Es ist die zutiefst unmoderne Disziplin, zu wissen, welches Problem man löst, zu prüfen, was das System tatsächlich sehen kann, und skeptisch gegenüber Arbeit zu bleiben, die einen beeindruckt.
Das ist dieselbe Fähigkeit, die schon immer eine gute Diagnose von einer teuren getrennt hat. Sie hat sich nicht geändert. Sie ist nur wertvoller geworden, weil die Maschinerie danach jetzt sehr schnell läuft.
Häufig gestellte Fragen
Warum scheitern KI-Projekte, wenn die Technologie funktioniert? Fast immer wegen der Problemdefinition, des verfügbaren Kontexts oder des Abdriftens über eine lange Sitzung, nicht wegen der Modellqualität. Das System tut, worum es gebeten wurde, mit dem, was ihm gegeben wurde. Wenn eines von beidem falsch ist, macht Kompetenz die Ausgabe überzeugender statt richtiger.
Woher weiß ich, ob ein KI-System genug Kontext hat? Fragen Sie, was außerhalb seiner Daten liegen müsste, damit seine Schlussfolgerung falsch ist, und prüfen Sie dann genau diese eine Sache. Behandeln Sie bei Systemen, die wiederholt statt einmalig laufen, Zugriff als zentrale Designfrage: Listen Sie auf, was es sehen können muss, damit seine Antworten vertrauenswürdig sind, und prüfen Sie, ob es alles davon hat.
Was ist KI-Schmeichelei, und warum ist das wichtig? Konversationelle Systeme sind darauf getrimmt, ermutigend zu sein, was sich über lange Sitzungen zu aufwendiger Arbeit summiert, die nie jemand hinterfragt hat. Am wichtigsten ist das, wenn Sie außerhalb Ihres eigenen Fachwissens arbeiten, was meist der Grund ist, warum Sie das Werkzeug überhaupt nutzen. Wirken Sie dem entgegen mit festen Anweisungen, die um Kürze und Widerspruch bitten, und indem Sie regelmäßig Ihr ursprüngliches Ziel neu formulieren.
Sollte ich einer sehr beeindruckenden KI-Ausgabe mehr oder weniger vertrauen? Weniger, bis Sie das Fundament geprüft haben. Die Qualität der Präsentation hat nichts mit der Richtigkeit der zugrunde liegenden Annahmen zu tun, und beeindruckende Ausgaben entmutigen genau die Prüfung, die sie am meisten brauchen.
Was ist die eine beste Gewohnheit, die man annehmen sollte? Verbringen Sie mehr Zeit mit der Problemdefinition, als sich angenehm anfühlt, bevor irgendetwas läuft. Fast jedes teure Scheitern lässt sich darauf zurückführen, dass dieser Schritt übersprungen wurde.